寻找最新最佳的RL人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Ornith-1.0 是 DeepReinforce 的智能体模型,专注于自我改进的长时程任务表现。其页面描述了一种训练设置:模型会编写任务脚手架、生成解题轨迹,并接收奖励信号,从而同时优化脚手架和最终行为。
该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层
Kimi k1.5 是由中国初创公司 Moonshot AI 开发的突破性 AI 模型,Moonshot AI 是一家在 AI 行业迅速崛起的中国初创公司。这种先进的多模态思维模型代表了 AI 能力的重大飞跃,在各种推理基准上的表现与 OpenAI 的全功能 O1 模型相当。这一成就尤其值得注意,因为 Kimi k1.5 是第一个在没有任何限制或限定词