寻找最新最佳的Freemium人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Seedance 2.5 是字节 Seed 推出的视频生成模型,用于创建更长的叙事片段,并具备更强的提示遵循、镜头连续性和面向制作的控制能力。它面向需要从文本和视觉参考中获得电影化运动、角色一致性以及灵活场景调度的创作者。
该模型聚焦参考感知生成与编辑,使用户能够比基础文生视频流程更精确地控制风格、主体身份、镜头行为和场景变化。其
Qwen-Image 3.0 是 Qwen-Image 系列第三代基础图像生成模型。它专注于丰富内容、真实视觉细节、深层知识以及面向复杂 UI 的图像生成,适合实际创意与设计任务。
该模型面向的不只是单一简单主体提示,还能处理密集信息图、分镜、界面、多语言文本和知识密集型场景。Qwen 将其定位为通过结合细节渲染与更强的指令理解来
CrisperWhisper 2.0 是 Nyra Labs 的逐字语音识别模型,用于转录人们实际说话的方式。它支持用于制作语音工作流程的可控输出样式、多语言转录、字级计时和长格式音频处理。
该系统区分保留填充、重复、截止和声音的逐字记录和生成更清晰可读文本的预期记录。它还通过监督 Whisper 式的交叉注意行为来提高对齐,以产
Ideogram 4 是一款开放权重图像生成模型,面向设计工作、真实感 2K 输出、多语言文字渲染和精确布局控制。它为需要强提示遵循和可编辑设计元素的创作者、开发者和企业而设计。
该模型在重建图像前先学习理解结构,采用“描述到结构到重建”的流程来识别物体、背景、排版、构图和布局。因此,它适合海报、产品视觉、营销素材、UI 模型稿以
Mirelo Audio-to-MIDI 是一个音乐转录模型和产品,可将完整混音音频转换为可编辑的 MIDI 轨道。用户可以上传 WAV 或 MP3 录音,并获得针对人声、鼓、贝斯、键盘、合成器等检测到的乐器部件的分轨音符数据,然后在 Mirelo Studio 中查看或导出结果。
底层的 MuScriptor 模型将多乐器转录表
Kimi K3 是 Moonshot AI 面向长上下文推理、智能体编码、知识工作和视觉问题求解的前沿级多模态模型。它被定位为一个拥有 2.8 万亿参数、3T 级别、原生支持视觉且具备 100 万 token 上下文窗口的模型,为团队提供一个可覆盖仓库级开发、重文档分析和多模态工作流的统一模型。
该模型结合了 Kimi Delta
Claude Sonnet 5 是 Anthropic 的 Sonnet 系智能体模型,面向编程、推理、工具使用、知识工作以及浏览器或终端工作流。Anthropic 将其定位为一款成本更低、但在若干智能体任务上接近更大 Opus 4.8 模型性能的产品。
该模型能够制定计划、使用工具、在 Claude Code 中运行,并通过 e
LongCat-2.0 是一个大规模混合专家语言模型,总参数量为 1.6 万亿,每个 token 约激活 480 亿参数。它面向长上下文推理、编程、工具使用、研究以及智能体工作流,并在发布中描述了公开模型和 API 访问方式。
该模型引入了 LongCat Sparse Attention,通过流式感知、跨层和分层索引来降低超长输
Fish Audio S2 是一套富表现力的开源文本转语音模型发布,核心是 S2 Pro,即 Fish Audio 的 40 亿参数多语言语音模型。它专为自然、逼真的语音生成而构建,支持情感、风格指令、多说话人控制、语音克隆以及行内韵律控制。
S2 Pro 采用双自回归架构,其中 40 亿参数的 Slow AR 组件负责语义预测,
GPT-5.6 Sol 是 OpenAI 下一代旗舰模型的预览版,被定位为其迄今为止在编程、科学工作、网络安全和长时程智能体任务方面能力最强的模型。它与 GPT-5.6 Terra 和 Luna 一同发布预览,其中 Sol 是能力最高的层级。
该模型引入了新的最大推理强度,用于更深入的单智能体推理,以及一种使用子智能体来加速复杂工
Seed2.1 是字节跳动 Seed 面向真实生产力场景的下一代模型家族,提供 Pro 和 Turbo 两种规格。它面向通用智能体、代码工程、办公工作、研究流程、多模态理解和视频理解。
该模型家族提升了规划、文件处理、工具使用、编码、调试和验证等多步任务执行能力,也增强了知识、推理、视觉理解、空间推理、长上下文处理以及长达数小时视
Claude Fable 5 和 Claude Mythos 5 是 Anthropic 发布的前沿模型,被描述为 Mythos 级系统,其中 Fable 5 面向更广泛的一般使用场景,而 Mythos 5 则保留给可信访问计划。公告强调它们在软件工程、知识工作、视觉、科学研究以及长而复杂任务上的能力提升。
这次发布的重点是让高能
Gemini Live Translate 是 Google 基于 Gemini 提供的近实时语音翻译体验,面向自然口语对话。公告称它可通过 Google AI Studio、Google Translate 和 Google Meet 使用,重点在于流畅的语音翻译,而不只是文本字幕。
该功能为低延迟听说场景而构建,希望译后的语音
Qwen 3.7 是 Qwen 大型语言模型版本,专为高级推理、代理工具使用、编码、多模式工作流程和一般助理任务而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen 3.7 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能
Qwen Live Translate 是 Qwen 生态系统中的实时翻译模型,专为语音或会话工作流程的实时多语言翻译而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen Live Translate 并不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理
Step 3.7 Flash 是一个针对现实世界代理的高效多模式 Flash 模型,专为使用工具的代理而设计,这些代理可以理解图像、搜索网络、编排工具以及跨常见工具执行操作。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Step 3.7 Flash 不是提供通用演示,而是针对具体的能力差
Scenema Audio 是一种富有表现力的音频生成模型,适用于零样本语音克隆、情感语音、歌唱和表演驱动的语音合成。它的设计目的不仅是生成文字,还可以通过节奏、呼吸、笑声、叹息、情感和声音效果来进行声乐表演。该产品将语音识别与情感传递分开,因此简短干净的参考剪辑可以定义音色,同时提示控制性能。
该模型提取自 LTX 2.3,并使
LabOS 是一个面向现代实验室的 AI-XR 联合科学家平台,它将代理推理与现实世界的实验执行联系起来。它旨在通过结合多模式人工智能代理、XR 智能眼镜、实验室专用视觉语言模型和文档工作流程,帮助科学家从干实验室规划转向湿实验室行动。目标是让人工智能看到研究人员所看到的内容,推理协议状态,并实时指导或验证物理实验步骤。
该系统是
Krea 2 是 Krea 围绕美学、风格控制和快速创意迭代构建的形象基础模型。它专为那些想要具有表现力的人工智能图像的创作者而设计,这些图像可以遵循视觉方向,而不仅仅是满足字面提示。该模型支持风格参考和情绪板,让用户可以使用一张图像或一组精选的视觉示例来指导输出。
产品注重审美理解、快速生成、可控视觉识别。风格参考让 Krea
Waypoint 1.5 是 Overworld 的实时 AI 世界模型,旨在将交互式生成的世界带入日常 GPU。它专注于通过减少通常与高端生成环境相关的硬件障碍,使世界模拟变得更容易。该产品面向那些想要实时世界而不依赖昂贵的工作站规模推理的创作者、开发者和研究人员。
该系统围绕实时世界生成和运行时效率进行了优化,使用模型和渲染改