AI Search LogoAI Search
/ RL

RL AI

寻找最新最佳的RL人工智能。浏览最全面的AI数据库,每日持续更新。

最新

Ornith-1.0

NewFree智能体RL

Ornith-1.0 是 DeepReinforce 的智能体模型,专注于自我改进的长时程任务表现。其页面描述了一种训练设置:模型会编写任务脚手架、生成解题轨迹,并接收奖励信号,从而同时优化脚手架和最终行为。

该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层

Kimi k1.5

热门
New聊天Kimi k1.5, 多模态模型

Kimi k1.5 是由中国初创公司 Moonshot AI 开发的突破性 AI 模型,Moonshot AI 是一家在 AI 行业迅速崛起的中国初创公司。这种先进的多模态思维模型代表了 AI 能力的重大飞跃,在各种推理基准上的表现与 OpenAI 的全功能 O1 模型相当。这一成就尤其值得注意,因为 Kimi k1.5 是第一个在没有任何限制或限定词

写作图像生成艺术聊天机器人语音音乐视频客户服务约会社交媒体营销编程投资旅行学习自动化健康动漫生产力电子商务语言AI检测研究金融播客摘要生成教育工作角色扮演免费

Check out our YouTube for AI news & in-depth tutorials!