大模型的后训练这一环节, 首次实现了由人工智能完全自主地全程操作完毕。专门名为AIBuildAI的团队, 在最近时间把PostTrain Agent这一工具开源了出来。

这个开源的内容包括了从设计算法到实际运行实验在内的全部步骤, 且过程中一点人工都不需要介入使用。这件事情已经在行业内引发了非常广泛的讨论和关注。

代码知识库全面开源

AIBuildAI团队最近已经把PostTrain Agent正式给公布了, 然后把所有的源代码还有配套的那个知识库也全部都开源了。这个系统接收基座模型、目标能力和算力预算这三样东西作为输入, 然后就会自动把训练的过程给完成好, 最后把训练出来的那个结果模型直接输出给您看。

这个Agent是基于递归自我改进这样的架构来搭建的。它把所有的环节都覆盖住了。这些环节具体包括算法的设计。还有数据的收集整理工作。以及代码的编写过程。此外, 还包含实验的执行任务。以及随后的迭代改进步骤。从最初启动的那一刻起。一直到最后的交付完成。整个全程不需要任何人类的介入。

单卡十小时限定挑战

根据PostTrainBench这个基准的规矩, 我们需要拿Qwen3-4B-Base当成基座模型来做事情。具体的操作过程是, 要在单张H100显卡上面跑训练, 而且得在十个小时之内把目标能力完成。

等目标能力完成之后, 再进行后训练。最后一步是把产出的checkpoint放到一个评测集上去打分, 而这个评测集是完全不可见的, 也就是Agent没法提前接触到这些数据。

以前的榜单在设定基线的时候, 采用的做法是把像Claude Code这样的代码智能体, 直接指向那个任务去操作, 让它在一个单独的命令行之内的对话场景里, 自己去规划该怎么做, 去撰写代码, 去进行模型训练, 还去把评估工作给完成, 但是这种做法缺少对于特定行业的专业知识, 也没有利用结构化搜索的能力。

知识库驱动实验决策

当实验员在进行设计决策的时候, 他们会把任务描述, 还有当前的方案以及失败的原因发送给知识库那边, 然后就会获取到一个匹配到的方法文件, 接着再去决定接下来具体的操作是什么样的,这个文件里面包含着适用的条件, 还有目标函数,同时也包含有数字算例以及现成库的实现内容。

这个机制有效地避免了一些常见的错误, 比如有的人可能选择了没有库可以实现的方法, 还有人使用了和评测集合在一起的数据, 再或者把模型规模的超参数套错了, 这些问题在之前的情况下, 每一项错误都要花费整整一个训练周期才能被发现并且修正过来。。

阶段式替代整树搜索

系统抛弃了对整个实验树进行搜索的做法, 而是改由元Agent按照阶段来编写程序, 在每一个阶段执行任务完成之后读取剩余的预算情况, 然后把相关数据和交棒给下一代的元Agent依据实测结果来继续编写下一阶段的内容, 此时搜索的拓扑结构不再保持预先固定的状态。

典型的方案是先做好准备, 把任务自己带的那份数据和外部的构建数据这两份材料拿出来用作监督微调的对象, 接着从中筛选出表现最优的模型, 随后进入逐轮实施GRPO训练的环节, 这一环节的规矩是只有当验证集的分数出现提升状况的时候才允许保留新模型, 整个过程需要反复进行迭代操作, 直到花费掉全部的预算为止。

四项基准均超人类参考

借助知识系统来选对训练框架以及匹配数据集, AIBuildAI在四个基座模型上进行测试, 得分均不低于94, 平均分为95.8, 是七项任务中唯一超过人类参考分85.0的项目。

那个Agent依旧在运行的状态之中, 它是在GPU上面完成了对那个开源的教师模型的部署工作, 由此生成了将近6800段的包含多轮互动的对话内容, 这些被用来当作训练所使用的数据, 经过了从子集进行筛选以及使用完整的评测集来进行双重确认的一系列操作之后, 最终达到的分数是48.6分。

471行代码零人工生成

整个程序总共包含471行Python代码, 以及8个文件, 里面含有一个搜索编排器、五个Agent角色和两个确定性程序, 它们全部都是靠一个元Agent在训练开始之前的一次会话中自主生成的。

AI已经不再专门去执行那种由人类提前设定好的人工训练方案了, 它现在是自己动脑筋提出假设的, 也是自己构建实验环境的, 还是自己分析各种证据来做事的, 并且不断地进行改进和调整, 所以说在大型模型进行后期训练的这个过程里, 正在走向一个由人工智能自己作为主要驱动力的全新阶段。

你就认为那个全自动的后训练技术, 能够用多快的速度去替代人工流程呢, 欢迎点赞并且分享, 在评论区里聊聊你个人的看法。