寻找最新最佳的Freemium人工智能。浏览最全面的AI数据库,每日持续更新。
最新
MiniMax Music 3.0 是一种音乐生成模型,可将创意概念和可选歌词转化为完整的歌曲。它在一代人的时间内创作、编曲、表演并产生结果。
该模型旨在保留长达五分钟的歌曲的表达意图,以物理真实感渲染乐器,并产生听起来像是表演的声音。其管道使用细粒度时间描述、全局局部混合LM、残差矢量量化、隐藏状态融合、流匹配和Flow-VAE
GLM-5.3是Z.ai的前沿编码和长视野智能体模型。它针对的是复杂的软件工程、研究工作流程以及需要代理跨多个相关步骤进行操作的任务。
该版本保留了 GLM-5.2 基本模型,并将其收益归因于扩展后训练。 Z.ai 扩展了可执行环境,合成了验证器,使用了异步强化学习,并为长任务保留了 SAO 压缩。
GLM-
LTX-2.5 是 LTX 用于生成和编辑视频的开源基础模型。它将更强大的精炼模型与改进的即时理解、更清晰的运动、原生多镜头一致性、自动持续时间预测和专业媒体工作流程结合在一起。
该版本添加了更好的视频解码器、带有自定义提示增强器的 Gemma 4 12B 文本编码器、测试版精确视频编辑、原生 4K HDR 和 RAW 支持,以及
CrisperWhisper 2.0 是 Nyra Labs 的逐字语音识别模型,用于转录人们实际说话的方式。它支持用于制作语音工作流程的可控输出样式、多语言转录、字级计时和长格式音频处理。
该系统区分保留填充、重复、截止和声音的逐字记录和生成更清晰可读文本的预期记录。它还通过监督 Whisper 式的交叉注意行为来提高对齐,以产
Ideogram 4 是一款开放权重图像生成模型,面向设计工作、真实感 2K 输出、多语言文字渲染和精确布局控制。它为需要强提示遵循和可编辑设计元素的创作者、开发者和企业而设计。
该模型在重建图像前先学习理解结构,采用“描述到结构到重建”的流程来识别物体、背景、排版、构图和布局。因此,它适合海报、产品视觉、营销素材、UI 模型稿以
Seedance 2.5 是字节 Seed 推出的视频生成模型,用于创建更长的叙事片段,并具备更强的提示遵循、镜头连续性和面向制作的控制能力。它面向需要从文本和视觉参考中获得电影化运动、角色一致性以及灵活场景调度的创作者。
该模型聚焦参考感知生成与编辑,使用户能够比基础文生视频流程更精确地控制风格、主体身份、镜头行为和场景变化。其
Qwen-Image 3.0 是 Qwen-Image 系列第三代基础图像生成模型。它专注于丰富内容、真实视觉细节、深层知识以及面向复杂 UI 的图像生成,适合实际创意与设计任务。
该模型面向的不只是单一简单主体提示,还能处理密集信息图、分镜、界面、多语言文本和知识密集型场景。Qwen 将其定位为通过结合细节渲染与更强的指令理解来
Kimi K3 是 Moonshot AI 面向长上下文推理、智能体编码、知识工作和视觉问题求解的前沿级多模态模型。它被定位为一个拥有 2.8 万亿参数、3T 级别、原生支持视觉且具备 100 万 token 上下文窗口的模型,为团队提供一个可覆盖仓库级开发、重文档分析和多模态工作流的统一模型。
该模型结合了 Kimi Delta
Mirelo Audio-to-MIDI 是一个音乐转录模型和产品,可将完整混音音频转换为可编辑的 MIDI 轨道。用户可以上传 WAV 或 MP3 录音,并获得针对人声、鼓、贝斯、键盘、合成器等检测到的乐器部件的分轨音符数据,然后在 Mirelo Studio 中查看或导出结果。
底层的 MuScriptor 模型将多乐器转录表
Claude Sonnet 5 是 Anthropic 的 Sonnet 系智能体模型,面向编程、推理、工具使用、知识工作以及浏览器或终端工作流。Anthropic 将其定位为一款成本更低、但在若干智能体任务上接近更大 Opus 4.8 模型性能的产品。
该模型能够制定计划、使用工具、在 Claude Code 中运行,并通过 e
LongCat-2.0 是一个大规模混合专家语言模型,总参数量为 1.6 万亿,每个 token 约激活 480 亿参数。它面向长上下文推理、编程、工具使用、研究以及智能体工作流,并在发布中描述了公开模型和 API 访问方式。
该模型引入了 LongCat Sparse Attention,通过流式感知、跨层和分层索引来降低超长输
Fish Audio S2 是一套富表现力的开源文本转语音模型发布,核心是 S2 Pro,即 Fish Audio 的 40 亿参数多语言语音模型。它专为自然、逼真的语音生成而构建,支持情感、风格指令、多说话人控制、语音克隆以及行内韵律控制。
S2 Pro 采用双自回归架构,其中 40 亿参数的 Slow AR 组件负责语义预测,
GPT-5.6 Sol 是 OpenAI 下一代旗舰模型的预览版,被定位为其迄今为止在编程、科学工作、网络安全和长时程智能体任务方面能力最强的模型。它与 GPT-5.6 Terra 和 Luna 一同发布预览,其中 Sol 是能力最高的层级。
该模型引入了新的最大推理强度,用于更深入的单智能体推理,以及一种使用子智能体来加速复杂工
Seed2.1 是字节跳动 Seed 面向真实生产力场景的下一代模型家族,提供 Pro 和 Turbo 两种规格。它面向通用智能体、代码工程、办公工作、研究流程、多模态理解和视频理解。
该模型家族提升了规划、文件处理、工具使用、编码、调试和验证等多步任务执行能力,也增强了知识、推理、视觉理解、空间推理、长上下文处理以及长达数小时视
Claude Fable 5 和 Claude Mythos 5 是 Anthropic 发布的前沿模型,被描述为 Mythos 级系统,其中 Fable 5 面向更广泛的一般使用场景,而 Mythos 5 则保留给可信访问计划。公告强调它们在软件工程、知识工作、视觉、科学研究以及长而复杂任务上的能力提升。
这次发布的重点是让高能
Gemini Live Translate 是 Google 基于 Gemini 提供的近实时语音翻译体验,面向自然口语对话。公告称它可通过 Google AI Studio、Google Translate 和 Google Meet 使用,重点在于流畅的语音翻译,而不只是文本字幕。
该功能为低延迟听说场景而构建,希望译后的语音
Step 3.7 Flash 是一个针对现实世界代理的高效多模式 Flash 模型,专为使用工具的代理而设计,这些代理可以理解图像、搜索网络、编排工具以及跨常见工具执行操作。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Step 3.7 Flash 不是提供通用演示,而是针对具体的能力差
Qwen Live Translate 是 Qwen 生态系统中的实时翻译模型,专为语音或会话工作流程的实时多语言翻译而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen Live Translate 并不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理
Qwen 3.7 是 Qwen 大型语言模型版本,专为高级推理、代理工具使用、编码、多模式工作流程和一般助理任务而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Qwen 3.7 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能
Krea 2 是 Krea 围绕美学、风格控制和快速创意迭代构建的形象基础模型。它专为那些想要具有表现力的人工智能图像的创作者而设计,这些图像可以遵循视觉方向,而不仅仅是满足字面提示。该模型支持风格参考和情绪板,让用户可以使用一张图像或一组精选的视觉示例来指导输出。
产品注重审美理解、快速生成、可控视觉识别。风格参考让 Krea