Anthropic展示用AI训练AI新方法
IT时代网8月29日消息,用AI模型训练其他AI模型,正成为新一代AI实验室重点探索的方向。当地时间28日,Anthropic研究员计划的一名成员展示了这种思路真正落地后的样子。
Anthropic发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用AI系统改善模型在一系列对齐基准测试中的表现。研究团队针对10种具体的失调行为设置测试,自动化系统最终让全部10项指标都有所改善,同时没有牺牲模型整体能力。
这套系统由Anthropic研究员计划成员陈岳翰领导开发,工作流程与传统科研相似:先查阅已有文献,提出训练方法,再按方案训练模型30分钟,通过多轮尝试逐步提高测试成绩,有效方案留下、无效方案淘汰,使研究过程能快速扩大规模。
论文指出,这初步证明自动化对齐后训练有望在近期成为可行方法,也向递归自我改进迈出一步。最优秀的自动化对齐研究员方法平均只需6小时,就能超过经验丰富的人类研究人员提出的方案。成本上,自动化系统每小时约需4美元API推理成本,而支付给人类研究人员的费用是每小时150美元。不过该方法仍有明显限制:效果首先取决于基准测试能否准确反映真正的对齐目标,建立和长期维护这些基准仍需大量投入。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。
THE END