寻找最新最佳的LLM 工具人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Claude Sonnet 5 是 Anthropic 的 Sonnet 系智能体模型,面向编程、推理、工具使用、知识工作以及浏览器或终端工作流。Anthropic 将其定位为一款成本更低、但在若干智能体任务上接近更大 Opus 4.8 模型性能的产品。
该模型能够制定计划、使用工具、在 Claude Code 中运行,并通过 e
LongCat-2.0 是一个大规模混合专家语言模型,总参数量为 1.6 万亿,每个 token 约激活 480 亿参数。它面向长上下文推理、编程、工具使用、研究以及智能体工作流,并在发布中描述了公开模型和 API 访问方式。
该模型引入了 LongCat Sparse Attention,通过流式感知、跨层和分层索引来降低超长输
Agents-A1 是一个 35B 混合专家智能体语言模型,面向长时程搜索、工程、科学研究、指令遵循和工具调用。它针对模型需要规划、检查中间状态、保持约束并完成多步任务,而非仅回答单一孤立提示的工作流。
该模型通过领域落地的 knowledge-action graph 和三阶段配方进行训练。全领域监督微调建立广泛的智能体行为,领
Seed2.1 是字节跳动 Seed 面向真实生产力场景的下一代模型家族,提供 Pro 和 Turbo 两种规格。它面向通用智能体、代码工程、办公工作、研究流程、多模态理解和视频理解。
该模型家族提升了规划、文件处理、工具使用、编码、调试和验证等多步任务执行能力,也增强了知识、推理、视觉理解、空间推理、长上下文处理以及长达数小时视
GPT-5.6 Sol 是 OpenAI 下一代旗舰模型的预览版,被定位为其迄今为止在编程、科学工作、网络安全和长时程智能体任务方面能力最强的模型。它与 GPT-5.6 Terra 和 Luna 一同发布预览,其中 Sol 是能力最高的层级。
该模型引入了新的最大推理强度,用于更深入的单智能体推理,以及一种使用子智能体来加速复杂工
MiniCPM5-1B 是一种紧凑的 1B 级语言模型,专为高效指令跟踪、工具感知聊天以及轻量级本地或边缘部署而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 MiniCPM5-1B 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生成或 A
ZAYA1-8B 是 Zyphra 的紧凑型专家混合语言模型,旨在以较小的活跃参数预算实现高智能密度。该模型被设计为在推理、数学和编码方面表现强劲,同时保持足够高的效率,能够适用于更广泛的部署。它的发布突出了一条发展路径,即更小的活跃模型可以在有针对性的高难度基准测试中与规模大得多的开放权重系统和专有系统竞争。
该模型在 AMD
TokenDial 是一个专注于生成语言模型中令牌级控制、分析或调整的研究项目。它专为需要更直接地处理令牌如何影响模型行为、解码和输出结构的用户而设计。该产品与 LLM 可解释性、可控生成、即时工程和推理时间引导相关。
该系统可能公开了一种在生成过程中检查或操纵令牌分布、令牌重要性或解码行为的方法。从技术上讲,令牌级别的干预可以影
TokenLight 是一个专注于人工智能模型工作流程中令牌级行为的研究项目。它专为想要了解、减少或优化令牌使用、令牌重要性或令牌级计算的用户而设计。该产品与 LLM 效率、可解释性、上下文优化和推理时间分析相关。
该系统可能会研究令牌如何影响输出质量、注意力行为或计算成本。令牌级方法可以支持重要上下文的修剪、突出显示、压缩、路由
Terminator LLM 是一种面向代理的语言模型系统,专为比标准聊天机器人更高级的任务执行而构建。它适用于模型必须通过指令进行推理、管理上下文并且表现得更像一个工作系统而不是对话玩具的情况。这使得它与代理工作流程和结构化自动化相关。
该模型定位于需要持久性和任务重点的用例。它不只是生成简短的答案,而是更好地理解为多步骤工作、
DataFlow 是一个先进的、以数据为中心的系统,专门为生成、准备和精炼高质量的训练数据而设计,这些数据对于大型语言模型 (LLM) 至关重要。认识到数据质量对模型性能至关重要,该框架将嘈杂的原始数据源(如纯文本、PDF 和低质量的问答对)转换为适用于各种训练方法(包括预训练、监督微调和强化学习)的结构化、干净的数据集。它对于医疗保健、金融、法律研究
IronClaw 被设计为一个强大的、开源的运行时解决方案,用于执行复杂的 AI 智能体,同时将敏感信息的绝对安全放在首位。它直接解决了那些不太安全的智能体框架中固有的关键漏洞,通过在 NEAR AI 云基础设施上托管的加密飞地内运行来实现。这种基础设计确保了,尽管智能体拥有浏览、研究和自动化等复杂任务所需的必要能力,但任何凭据、API 密钥或令牌都完
Respan 将自己定位为 essential LLM 工程平台,旨在为由大型语言模型驱动的复杂应用程序的开发和部署带来稳定性和可预测性。它通过将关键生命周期阶段——可观察性、评估、提示优化和部署——统一到一个连贯的环境中,从根本上解决了该领域迭代开发的混乱特性。这种统一确保了开发人员可以沿着清晰、可追溯的路径从初始实验过渡到规模化生产,消除了由于底层
ZeroClaw 自称为对话代理基础设施的演进,完全使用 Rust 构建,以实现无与伦比的效率和最小的资源消耗。它的核心承诺是“零开销。零妥协”,这体现在其大约 3.4MB 的极小二进制文件大小和即使在受限硬件上也能在 10 毫秒内惊人地快速启动时间。这种性能飞跃是通过精心设计的工程实现的,使其能够在成本仅为 10 美元的设备上有效运行,与 OpenC
JavisGPT是一个统一的多模态大型语言模型,专为联合音视频理解和生成任务而设计。它专注于同步发声视频场景,其中视觉流和音频轨道必须以时间对齐的方式一起被理解。系统架构将专用的音视频输入编码器与语言模型核心以及一个能够生成连贯、同步媒体输出的生成器连接起来。
通过整合独立的音频和视频输入,JavisGPT可以推理跨越这两种模态的复
HeartMuLa 代表了一系列突破性的开源音乐基础模型,旨在通过先进的组件(如用于音频-文本对齐的 HeartCLAP、用于真实场景中鲁棒歌词识别的 HeartTranscriptor,以及用于高保真、低帧率音乐分词的 HeartCodec,后者在保留长期音乐结构的同时兼顾细致的声学细节)来统一音乐生成与理解。该框架支持高效的自回归建模,使用户创作者
Bizgraph 是一款专为管理和部署大型语言模型 (LLM) 服务的机构、咨询公司和自由职业者设计的专业计费解决方案。它超越了简单的项目计费,专注于人工智能使用中细粒度的、基于消耗的特性。该软件架设在企业级 LLM 网关基础设施之上,无缝路由和监控定向到 OpenAI、Anthropic 和 Google 等主要提供商的 API 调用。这种集成消除了
LLM Ops 是一款专门用于管理大型语言模型(LLM)使用过程中迅速增长的成本的解决方案,该成本涉及各种平台。该工具专为使用生成式模型构建的组织设计,将关键的财务运营(FinOps)原则引入 LLM 世界。它通过实时跟踪 OpenAI、Anthropic 和 Google Gemini 等主要供应商的成本,提供对支出的即时、细粒度的可见性,解决了 L
Bloom 是一个开源的、脚手架式的评估系统,精心设计用于自动评估和浮现大型语言模型中特定的行为。其核心在于接受一个“评估配置”或“种子”作为输入。这个种子至关重要,因为它定义了目标行为——例如政治偏见、谄媚或自我保护——提供了说明该行为的示例对话记录,并指定了测试所需的交互类型。与固定的评估方法不同,Bloom 根据初始的种子动态生成一个不断增长和适
Grok 4.1 是 xAI 开发的最新大型语言模型,于 2025 年 11 月发布,是 Grok 系列的增量更新。该模型专注于增强创造性、情感和协作交互,使 AI 对话感觉更自然、更具情感智能。它可在 grok.com、X 社交媒体平台以及 iOS 和 Android 移动应用程序等各种平台上使用。此次发布遵循了两周的静默测试阶段,用户反馈有助于完善