寻找最新最佳的大语言模型人工智能。浏览最全面的AI数据库,每日持续更新。
最新
DeepSeek-V4-Flash-0731 是在 Hugging Face 上发布的开放权重语言模型,作为 DeepSeek V4 系列中更快、更小的激活参数变体。它针对需要强大能力和更高效推理的代理、编码和一般推理工作负载。
该模型包括一个推测性解码模块,并记录了用于 vLLM、SGLang 和本地推理流的服务。它的卡片强调
Claude Opus 5 是 Anthropic 的 Opus 层模型,适用于长期运行的代理、编码和专业知识工作。它被定位为对之前 Opus 模型的重大升级,在软件工程、推理繁重的任务和企业工作流程方面具有更强的性能。
该模型支持工作量设置,让客户可以权衡智能、延迟和令牌使用。与同一级别的早期模型相比,Anthropic 强调了
Kimi K3 是 Moonshot AI 面向长上下文推理、智能体编码、知识工作和视觉问题求解的前沿级多模态模型。它被定位为一个拥有 2.8 万亿参数、3T 级别、原生支持视觉且具备 100 万 token 上下文窗口的模型,为团队提供一个可覆盖仓库级开发、重文档分析和多模态工作流的统一模型。
该模型结合了 Kimi Delta
Bonsai 27B 是 PrismML 基于 Qwen3.6 27B 构建的低比特多模态语言模型家族,旨在让其能够在包括手机在内的消费级硬件上本地运行。该发布包含三值和 1 比特变体,在保留大模型能力层级的同时,将内存需求降低到适合笔记本、GPU 和手机级部署的水平。
三值版本每个权重的有效位宽为 1.71 bit,目标是在约
Inkling 是 Thinking Machines Lab 推出的开放权重多模态基础模型,面向定制、微调和智能体工作流。该发布将其描述为一个 Mixture-of-Experts Transformer,具有 975B 总参数、41B 激活参数、最高 100 万 token 的上下文窗口,并在文本、图像、音频和视频上进行训练。
GLM-5.2 是 Z.ai 的旗舰开放权重模型,适用于长期任务、代理编码和大规模工程工作。该版本描述了超越 GLM-5.1 的实质性功能跳跃,以及用于持续长上下文工作流程的可靠 1M 令牌上下文。
该模型通过灵活的思维努力水平改进了编码,并引入了架构更改(例如 IndexShare)以提高稀疏注意力效率。 Z.ai 还描述了用
Claude Fable 5 和 Claude Mythos 5 是 Anthropic 发布的前沿模型,被描述为 Mythos 级系统,其中 Fable 5 面向更广泛的一般使用场景,而 Mythos 5 则保留给可信访问计划。公告强调它们在软件工程、知识工作、视觉、科学研究以及长而复杂任务上的能力提升。
这次发布的重点是让高能
DiffusionGemma 是 Google 推出的基于扩散的文本生成模型,被定位为标准自回归解码的超快替代方案。公告称,它通过并行细化文本而不是严格逐 token 生成,可实现最高 4 倍更快的文本生成。
该模型将扩散思想应用到语言上,从带噪或不完整的文本状态出发,逐步去噪得到最终答案。这改变了交互式助手、批量生成系统,以及需
Step 3.7 Flash 是一个针对现实世界代理的高效多模式 Flash 模型,专为使用工具的代理而设计,这些代理可以理解图像、搜索网络、编排工具以及跨常见工具执行操作。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Step 3.7 Flash 不是提供通用演示,而是针对具体的能力差
MiniCPM5-1B 是一种紧凑的 1B 级语言模型,专为高效指令跟踪、工具感知聊天以及轻量级本地或边缘部署而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 MiniCPM5-1B 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生成或 A
Qwen 3.7 是 Qwen 大型语言模型版本,专为高级推理、代理工具使用、编码、多模式工作流程和一般助理任务而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen 3.7 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能
GPT Realtime 2 是 OpenAI 的实时语音模型,用于构建实时对话代理,这些代理可以在对话仍在进行时进行聆听、推理、说话和使用工具。它专为需要语音界面来完成实际工作的产品团队而设计,例如客户支持、日程安排、行程变更、车载辅助、教育和免提生产力。与简单的语音到文本加聊天机器人管道不同,GPT Realtime 2 是围绕单一实时代理体验中的
ZAYA1-8B 是 Zyphra 的紧凑型专家混合语言模型,旨在以较小的活跃参数预算实现高智能密度。该模型被设计为在推理、数学和编码方面表现强劲,同时保持足够高的效率,能够适用于更广泛的部署。它的发布突出了一条发展路径,即更小的活跃模型可以在有针对性的高难度基准测试中与规模大得多的开放权重系统和专有系统竞争。
该模型在 AMD
Talkie 是一种 13B 老式语言模型,仅使用 1931 年之前的文本进行训练。它旨在模拟与对现代世界没有直接了解的语言模型的交互,使其成为研究训练数据如何塑造模型行为、期望和世界知识的独特工具。该产品既是一个对话模型,也是一个研究工具。
Talkie的价值来自于它的历史约束。由于它是根据 1931 年之前的文本进行训练的,因
Ternary Bonsai 是 PrismML 版本,专注于以 1.58 位提供顶级智能。它是围绕极端量化或低位模型表示而设计的,其目标是保留有用的推理和模型功能,同时大幅降低内存和计算成本。该产品与高效推理、边缘部署、模型压缩和低成本人工智能服务相关。
从技术上讲,1.58 位三元表示意味着模型权重以高度压缩的离散格式存储,通
TokenDial 是一个专注于生成语言模型中令牌级控制、分析或调整的研究项目。它专为需要更直接地处理令牌如何影响模型行为、解码和输出结构的用户而设计。该产品与 LLM 可解释性、可控生成、即时工程和推理时间引导相关。
该系统可能公开了一种在生成过程中检查或操纵令牌分布、令牌重要性或解码行为的方法。从技术上讲,令牌级别的干预可以影
Claude Opus 4.7 是 Anthropic 的最新旗舰型号,与 Opus 4.6 相比具有显着改进。它专为需要仔细遵循指令和持续解决问题的高级软件工程、硬推理任务和专业工作流程而设计。该模型定位于需要在困难任务上获得高质量输出的用户,而不是成本最低的一般助理。
该模型可通过 Anthropic 产品和 API 界面进行
TokenLight 是一个专注于人工智能模型工作流程中令牌级行为的研究项目。它专为想要了解、减少或优化令牌使用、令牌重要性或令牌级计算的用户而设计。该产品与 LLM 效率、可解释性、上下文优化和推理时间分析相关。
该系统可能会研究令牌如何影响输出质量、注意力行为或计算成本。令牌级方法可以支持重要上下文的修剪、突出显示、压缩、路由
DeepSeek V4 是 DeepSeek 发布的开源大型语言模型,专注于经济高效的长上下文推理、编码和代理功能。该预览版包括可实现更高性能的 DeepSeek-V4-Pro 和可实现更快、更经济使用的 DeepSeek-V4-Flash。两种变体都围绕 1M 上下文支持和双重思考或非思考模式进行定位,为用户提供跨深度推理和低延迟工作流程的灵活性。<
Gemma 4 是 Google 迄今为止功能最强大的开放模型系列,专为高级推理和代理工作流程而构建。它专为想要高质量模型行为以及开放模型的透明度和部署灵活性的开发人员而设计。该版本与编码助手、研究工具、本地应用程序和企业人工智能系统相关,这些系统需要比封闭 API 允许的更多控制。
Gemma 4 基于 Google 的开放模型