该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层信任边界、确定性监控器以及冻结的 LLM 裁判等保护机制可减少奖励黑客行为。
Ornith-1.0 适用于研究智能体强化学习、脚手架搜索、编程智能体和长轨迹优化的研究人员。项目强调了用于异步训练的流水线式 RL,以及用于控制长轨迹中离策略 token 影响的陈旧度加权方法。
该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层信任边界、确定性监控器以及冻结的 LLM 裁判等保护机制可减少奖励黑客行为。
Ornith-1.0 适用于研究智能体强化学习、脚手架搜索、编程智能体和长轨迹优化的研究人员。项目强调了用于异步训练的流水线式 RL,以及用于控制长轨迹中离策略 token 影响的陈旧度加权方法。
在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!


Get top updates in AI to your inbox every weekend. It's free!