当 Agent 已能并行跑出很多候选,瓶颈往往不是再生成一条,而是能否看懂过程、稳定排序,并知道从哪一步开始走偏。这篇拆解连续概率验证、PPT、进度信号与稠密 RL 奖励。
把数学、代码、对话和工具装进一个基模:后训练能力整合的四条路线
从 Mixed RL、Cascade RL、参数合并到多教师 MOPD:当数学、代码、通用对话与工具调用都要住进同一个基模,工业后训练到底怎样做能力整合?
我把 DeepSeek Harness 的日志变成了 Agent 的自诊断医生:loop-doctor 插件家族开源
DeepSeek Harness 把每次运行事实写进 SessionEvent 日志,却没人读。loop-doctor 让 harness 读自己的日志做自诊断:确定性 detour 检测、回放验证的建议、人审后的修复沉淀,140 个测试全绿,已开源。
我把 Agent 自进化飞轮拆成了四件事:评测、记忆、落地、控制
评测、记忆、Self-Improve 在多数团队里被拆散着做,飞轮转不起来。这篇文章把我整理的 Agent 自进化方法论拆成四个齿轮:评测(信号)、记忆(积累)、落地(工程化)、控制(人机协作)。
从兴趣代码到 AI 工程:我的 GitHub 近况
从 HealthFlow 的多模态医疗辅助流程,到 DuckCoding 的浏览器自动化,这一年我开始把更多兴趣代码做成可运行、可解释、可复用的工程。
