寻找最新最佳的智能体 AI人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Needle 2 是一种紧凑的代理语言模型,用于微型设备上的工具调用、设备使用和结构化提取。完整的模型是一个 14 MB 的二进制文件,在大约 28 MB 的 RAM 中运行。
它建立在简单注意力网络的基础上,使用 Cactus Quants 压缩为 CQ2 位,并打包在 Cactus 自己的引擎中。浏览器演示在 WebAssem
MatrAIx 是数字产品和人工智能系统的模拟用户评估基础设施。它对 83 亿角色代理群体进行建模,以便团队可以测试不同用户对产品、对话、界面和工作流程的响应。
该平台围绕用户是谁、交互发生的地点和方式以及正在测试的应用程序或任务来组织评估。它支持调查、聊天机器人、网络和应用程序模拟,输出涵盖偏好、任务完成、帮助性、安全性、可用性
GEN-1.5 是一个机器人基础模型,可以通过单个简短的演示来学习新的物理任务。它通过将感觉运动观察和动作轨迹映射到即时机器人行为来实现体现智能。
该模型可以在 30 秒的上下文窗口内放置一个演示,并在无需梯度更新或微调的情况下执行任务。它还可以在五分钟的任务数据上仅使用 1 到 10 个梯度步骤进行适应,而大规模物理交互体验的预
LLM-as-a-Verifier 是一个通用验证框架,可为跨模式的代理输出提供细粒度的反馈。它将验证视为编码、机器人、医疗任务和其他二进制判断过于粗糙的领域的缩放轴。
该方法使用评分令牌逻辑的完整分布来估计连续奖励和评估不确定性,无需额外训练。它通过更精细的分数粒度、重复评估和评估标准分解来扩展验证,然后使用概率枢轴锦标赛在有限
Grok 4.6 是 xAI 的模型,适用于长期运行的代理、雄心勃勃的交互式工作、编码、研究和知识任务。它旨在跨多个步骤继续工作,从调查不熟悉的领域到生成精美的应用程序或工作工件。
该版本强调视觉和交互式项目的更强有力的首次通过、跨代码库的持续工作以及通过反馈持续改进。 xAI 报告使用精心策划的推理和技术数据、改进的优化器、监督
WorldClaw是腾讯混元推出的一款代理3D开放世界生成项目。它探讨了 AI 代理如何在大型交互式 3D 环境中创建、编辑和操作,而不是仅生成孤立的资产。
该系统将语言驱动的规划与 3D 世界构建和交互联系起来。其研究方向结合了场景生成、资产创建、空间推理和代理控制,以便可以大规模构建世界,然后将其用作可执行环境。
Claude Opus 5 是 Anthropic 的 Opus 层模型,适用于长期运行的代理、编码和专业知识工作。它被定位为对之前 Opus 模型的重大升级,在软件工程、推理繁重的任务和企业工作流程方面具有更强的性能。
该模型支持工作量设置,让客户可以权衡智能、延迟和令牌使用。与同一级别的早期模型相比,Anthropic 强调了
Kimi K3 是 Moonshot AI 面向长上下文推理、智能体编码、知识工作和视觉问题求解的前沿级多模态模型。它被定位为一个拥有 2.8 万亿参数、3T 级别、原生支持视觉且具备 100 万 token 上下文窗口的模型,为团队提供一个可覆盖仓库级开发、重文档分析和多模态工作流的统一模型。
该模型结合了 Kimi Delta
Ornith-1.0 是 DeepReinforce 的智能体模型,专注于自我改进的长时程任务表现。其页面描述了一种训练设置:模型会编写任务脚手架、生成解题轨迹,并接收奖励信号,从而同时优化脚手架和最终行为。
该方法将脚手架生成视为策略的一部分,而不是固定的人工设计外壳。来自下游轨迹的奖励会反向传播到脚手架构建阶段,同时不可变外层
Seed2.1 是字节跳动 Seed 面向真实生产力场景的下一代模型家族,提供 Pro 和 Turbo 两种规格。它面向通用智能体、代码工程、办公工作、研究流程、多模态理解和视频理解。
该模型家族提升了规划、文件处理、工具使用、编码、调试和验证等多步任务执行能力,也增强了知识、推理、视觉理解、空间推理、长上下文处理以及长达数小时视
QUEST 是一个由 2B 到 35B 深度研究代理组成的开放家族,经过完全合成的红字树任务训练。这些模型的目标是跨客观和开放式研究基准的事实查找、引文基础和报告综合。
训练方法结合了基于标题树的任务合成、结构化上下文管理以及跨越训练中期、监督微调和强化学习的三阶段管道。该项目强调发布模型、数据、数据合成脚本和训练代码。
MiniMax M3 是 MiniMaxAI 在 Hugging Face 上发布的多模态模型,面向图文到文本、智能体、编码、视频和对话等用例。模型卡将其标注为基于 Transformer 的 safetensors 发布版本,并带有自定义代码和 minimax_m3_vl 架构。
页面提供了 Transformers 的使用示例
ReactiveGWM 是一种反应式游戏世界模型,旨在通过高级策略在生成的游戏世界中引导非玩家角色。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 ReactiveGWM 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。<
Step 3.7 Flash 是一个针对现实世界代理的高效多模式 Flash 模型,专为使用工具的代理而设计,这些代理可以理解图像、搜索网络、编排工具以及跨常见工具执行操作。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Step 3.7 Flash 不是提供通用演示,而是针对具体的能力差
Gamma-World 是一种生成式多智能体世界模型,专为超越两个可控玩家的交互模拟而设计,同时保持共享世界的一致性。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Gamma-World 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工
Qwen 3.7 是 Qwen 大型语言模型版本,专为高级推理、代理工具使用、编码、多模式工作流程和一般助理任务而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen 3.7 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能
LabOS 是一个面向现代实验室的 AI-XR 联合科学家平台,它将代理推理与现实世界的实验执行联系起来。它旨在通过结合多模式人工智能代理、XR 智能眼镜、实验室专用视觉语言模型和文档工作流程,帮助科学家从干实验室规划转向湿实验室行动。目标是让人工智能看到研究人员所看到的内容,推理协议状态,并实时指导或验证物理实验步骤。
该系统是
CausalCine 是一种用于多镜头叙事创作的实时自回归视频生成系统。它专为交互式导演而设计,用户可以在系统随意流式传输视频的同时附加新的镜头级提示。 CausalCine 不是生成单个孤立的剪辑,而是在各个镜头中维护故事背景,因此序列可以随着连续性和新的创意方向而演变。
该系统重用内容感知的 KV 内存来保留远程叙事上下文和跨
Articraft 是一个代理系统,用于生成铰接式 3D 资产,这些资产是为模拟和交互而构建的。它针对具有移动部件的对象,例如烤箱、抽屉、自行车、椅子、灯具和机械组件,而静态网格体在这些情况下是不够的。该系统旨在生成包括功能关节的资产,以便可以在模拟或交互式环境中对其进行操作。
核心工作流程使用编码代理,根据 LLM 友好的 SD
ARA(即 Agent-Native Research Artifacts)是一个将研究论文转换为结构化知识包的系统,AI 代理可以通过编程方式执行、检查和构建这些知识包。它的设计理念是,对于研究作者和研究读者都可能是人工智能系统的未来来说,静态 PDF 是一种糟糕的格式。 ARA 将研究成果重新想象为机器可操作的工件,而不是纯叙述性的文档。