关键功能

通过强化学习同时优化任务脚手架和解题轨迹。
让任务特定的编排策略自然涌现,而非为每个流程手写外壳。
将轨迹奖励反向传递到脚手架编写阶段。
使用不可变的外层信任边界约束自生成脚手架。
加入确定性监控以阻止对环境或验证器的非法访问。
使用冻结的 LLM 裁判作为额外的奖励黑客否决机制。
将流水线式 RL 用于长异步轨迹。
使用陈旧度加权来降低旧离策略 token 的影响。

该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层信任边界、确定性监控器以及冻结的 LLM 裁判等保护机制可减少奖励黑客行为。


Ornith-1.0 适用于研究智能体强化学习、脚手架搜索、编程智能体和长轨迹优化的研究人员。项目强调了用于异步训练的流水线式 RL,以及用于控制长轨迹中离策略 token 影响的陈旧度加权方法。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!