寻找最新最佳的图像人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Mage-Flow 是微软的一个研究型模型家族,用于原生分辨率图像生成和基于指令的图像编辑。它是一个紧凑的 4B 模型家族,旨在在支持快速交互式推理的同时生成高质量图像。
该项目强调原生分辨率生成、精确编辑和四步交互式推理。其方法面向实际编辑和生成工作流,适合需要快速反馈、准确指令遵循以及在相对紧凑模型中获得强视觉质量的用户。</
FLUX 3 是 Black Forest Labs 的多模式模型系列,适用于图像、视频、音频和动作预测工作流程。它被定位为跨越多种模式的一个模型,强调现实细节、风格控制和生产用例。
模型页面重点介绍了 FLUX 3 Video 功能、草稿和正常模式、生产采用以及跨模式改进,其中每种模式相互帮助。它专为需要生成在不同类型媒体上保持
MiniMax H3 是一个通用型全模态生成模型,能够理解文本、图像、视频和音频之间的多模态上下文。它旨在超越单任务生成器,通过单一模型家族实现更丰富的跨模态推理与生成。
该模型可生成带原生立体声音频的视频,支持最高 2K 分辨率输出,并可生成最长 15 秒的片段。其设计将多模态上下文理解与生成结合起来,适用于声音、运动、视觉细节
Ideogram 4 是一款开放权重图像生成模型,面向设计工作、真实感 2K 输出、多语言文字渲染和精确布局控制。它为需要强提示遵循和可编辑设计元素的创作者、开发者和企业而设计。
该模型在重建图像前先学习理解结构,采用“描述到结构到重建”的流程来识别物体、背景、排版、构图和布局。因此,它适合海报、产品视觉、营销素材、UI 模型稿以
Qwen-Image 3.0 是 Qwen-Image 系列第三代基础图像生成模型。它专注于丰富内容、真实视觉细节、深层知识以及面向复杂 UI 的图像生成,适合实际创意与设计任务。
该模型面向的不只是单一简单主体提示,还能处理密集信息图、分镜、界面、多语言文本和知识密集型场景。Qwen 将其定位为通过结合细节渲染与更强的指令理解来
Inkling 是 Thinking Machines Lab 推出的开放权重多模态基础模型,面向定制、微调和智能体工作流。该发布将其描述为一个 Mixture-of-Experts Transformer,具有 975B 总参数、41B 激活参数、最高 100 万 token 的上下文窗口,并在文本、图像、音频和视频上进行训练。
Lucida 是一个开源图像抠图和背景移除模型,专注于通用去背景工具常常处理不好的困难场景。它针对半透明物体、伪装图案、文字排版、柔和阴影、发光效果、线稿、插画以及贴纸和 T 恤图案等印刷风格设计进行了优化。
该模型是基于 BiRefNet 的微调版本,权重托管在 Hugging Face,代码仓库采用 MIT 许可证。项目包含覆
DanceOPD 是一种在单个 flow-matching 模型中组合多种图像生成能力的 on-policy 生成场蒸馏框架。它将每种源能力视为一个速度场,并训练学生模型在其自身访问到的状态上查询被选中的场。
该方法解决了目标场歧义、状态分布不匹配和轨迹查询相关性问题。它使用硬路由为每个样本选择一个冻结的能力场,在停止梯度的学生
TeleStyle V2 是一种内容保留风格转移和图像编辑模型,通过自蒸馏和分布匹配蒸馏构建。它将 TeleStyle V1 扩展到原始的现实内容和风格化参考设置之外,以处理内容和风格角色中的现实和风格化参考。
该模型使用 TeleStyle V1 构建自蒸馏三元组,然后使用分布匹配蒸馏来降低推理成本,同时保留 Qwen-Ima
Modality Forcing 是一个训练后配方,可将预训练的文本到图像模型转变为联合图像深度生成器。它利用 T2I 模型内的空间先验来合成图像和深度,而不需要密集的深度数据或复杂的训练方法。
该方法在稀疏深度数据上训练单个 DiT,每个模态和每个模态解码器具有单独的噪声级别。这使得模型能够以不同的排列执行图像和深度的条件联合
Boogu-Image-0.1 是一个 Apache-2.0 开源统一多模态理解、图像生成和图像编辑模型系列。它包括Base、Turbo、Edit和其他变体,用于文本到图像生成、快速生成、图像编辑和中英文文本渲染。
该项目通过改进模型理解、数据质量和训练流程,强调受限训练计算下的实用图像质量。该页面重点介绍了逼真的摄影、双语排版
i1 是普林斯顿推出的文生图扩散模型项目,重点在于用一种简单且完全开放的配方实现强图像生成能力。该工作研究建模与数据选择如何影响能力,最终形成一个在 1024 分辨率上评估的 30 亿参数模型。
项目研究了模型设计、文本与噪声条件、骨干架构、合成字幕、提示词改写、数据集混合以及训练与评估选择。它把开放性作为核心贡献之一,通过发布模
AnchorWorld 是一个具身第一人称世界模拟框架,支持基于视图的演化定制。它利用人体动作控制和与姿态关联的锚点视图,让智能体或玩家能够以第一人称视角探索定制化世界。
每个锚点视图都提供 RGB 图像、用于空间定位的 3D 姿态,以及说明场景应如何变化的演化提示。该方法结合了混合视角的人体动作控制、可演化的锚点视图定制和渐进式
L2P 是一种潜在到像素的传输范式,旨在构建强大的像素空间扩散模型,而无需从头开始训练。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 L2P 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
L2P
LongCat Video Avatar 1.5 是一个音频驱动的头像视频生成模型,旨在根据音频、图像和文本条件创建头像视频。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 LongCat Video Avatar 1.5 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的
PiD 是一种像素扩散解码器,专为潜在图像生成系统的快速高分辨率潜在解码和上采样而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 PiD 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
PiD
PIXLRelight 是一种可控的单图像重新照明模型,设计用于通过闪光灯或类似聚光灯的控件对单张照片进行物理可控的重新照明。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 PIXLRelight 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生
SEGA 是一种用于扩散变换器的分辨率外推方法,旨在无需重新训练即可生成稳定的超高分辨率图像。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 SEGA 没有提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
HiDream-O1 Image 是一个开放的图像生成基础模型,用于文本到图像的创建、图像编辑和主题驱动的个性化。它被构建为一个原生统一的图像生成模型,而不是一个由单独的编码器和生成器组成的松散管道。该模型的目标是以高达 2048 x 2048 的分辨率生成高质量的创意,同时在提示驱动的创作、布局敏感的渲染以及身份或主题一致性任务中保持灵活性。
Krea 2 是 Krea 围绕美学、风格控制和快速创意迭代构建的形象基础模型。它专为那些想要具有表现力的人工智能图像的创作者而设计,这些图像可以遵循视觉方向,而不仅仅是满足字面提示。该模型支持风格参考和情绪板,让用户可以使用一张图像或一组精选的视觉示例来指导输出。
产品注重审美理解、快速生成、可控视觉识别。风格参考让 Krea