欢迎阅读本期【AI日报】。今天的看点包括 OpenAI 新图像模型 GPT Image 1.5、腾讯混元世界模型 1.5、小米开源 MiMo-V2-Flash,以及字节跳动、Apple Music、Gemini、Adobe Firefly 和谷歌实验室带来的最新 AI 进展。

新鲜AI产品点击了解https://app..com/zh

今日重点

本期 AI 资讯主要围绕生成式模型、实时交互世界、开源大模型、音视频创作和智能助手展开。OpenAI 升级了图像生成能力,腾讯推出可实时探索的混元世界模型,小米则以 MIT 协议开源 MiMo-V2-Flash,进一步推动高性能模型的开放落地。

1、OpenAI 推出全新图像生成模型 GPT Image 1.5,性能显著提升!

OpenAI 发布新一代图像生成模型 GPT Image 1.5。相比之前版本,该模型在图像生成和编辑能力上均有提升,能更准确地理解并执行用户指令,同时尽量保留原图中的关键内容。针对 AI 绘图中常见的文字呈现问题,GPT Image 1.5 也对文本渲染进行了优化。

此外,OpenAI 还强化了安全与合规相关团队,以确保生成内容在伦理和法律层面更符合要求。


image.png

【提要:】

🌟 GPT Image1.5 在图像生成与编辑方面完成升级。

🖼️ 用户可通过 ChatGPT 创建和编辑图像,体验更接近专业工具的处理效果。

🔒 OpenAI 配备专门安全团队,推动生成内容符合伦理与合规要求。

2、腾讯发布混元世界模型 1.5,开启实时交互的虚拟世界

腾讯正式推出混元世界模型1.5(Tencent HY WorldPlay)。据介绍,这是国内首个开放的实时互动体验平台,用户可以通过文字或图片快速生成具有差异化的互动世界,并在其中进行实时探索。

该模型主打实时交互、长范围 3D 一致性和多样化互动体验。腾讯还首次开源了业内较为全面的实时世界模型训练体系,为 AI 生成内容在互动场景中的发展提供了新的可能。


image.png

【提要:】

🕹️ 支持实时交互生成,可按24帧每秒生成720P高清视频。

🌐 强调长范围 3D 一致性,以保持场景的连续与稳定。

🔧 首次开源相关训练体系,为 AI 生成内容提供更多探索空间。

详情链接:https://3d.hunyuan.tencent.com/sceneTo3D?tab=worldplay

3、小米开源3090亿参数MiMo-V2-Flash大模型,推理速度碾压主流竞品,API低至0.1美元/百万Token

小米正式进入高性能开源大模型领域,发布基础语言模型 MiMo-V2-Flash,并以 MIT 协议开放模型权重和推理代码。该模型以“超高速、高效率”为主要特征,在推理、代码生成和智能体任务中都有较突出表现。

根据原文信息,MiMo-V2-Flash 的实测响应速度超过豆包、DeepSeek、元宝等热门国产模型,因此引发了开发者社区关注。

【提要:】

🧠 MiMo-V2-Flash 采用稀疏激活架构,总参数量达到3090亿,每次推理仅激活150亿参数,从而降低计算开销。

⚡ 在多项公开基准测试中,该模型表现优秀,尤其在多轮对话和复杂逻辑推理场景中具备速度优势。

💰 API 价格具有竞争力,每百万输入Token为0.1美元,输出Token为0.3美元,为中小企业和独立开发者提供低成本选择。

4、字节跳动发布 Seedance 1.5 Pro:AI 音视频创作进入 100% 视听同步时代!

字节跳动发布 Seedance 1.5 Pro,重点强化音视频联合生成能力。该产品被定位为推动 AI 音视频创作进入 100% 视听同步阶段,为创作者带来更丰富的视听内容生成体验。


image.png

【提要:】

🎥 支持通过文本或图像引导进行音视频联合生成。

🎬 强化视听同步能力,使角色口型、语调和表演节奏更好匹配。

🎭 支持多语种和方言,提升喜剧等风格化内容的表现力。

5、Apple Music 将与 ChatGPT 实现全新集成,用户可轻松创建歌单!

OpenAI 宣布 Apple Music 将与 ChatGPT 集成。集成完成后,用户可以通过自然语言指令创建歌单,也可以借助 ChatGPT 查找音乐,从而提升音乐服务的使用便捷性。


image.png

【提要:】

🎵 Apple Music 将接入 ChatGPT,支持用户更方便地创建歌单。

💬 用户可用自然语言描述需求,快速生成合适的播放列表。

🔍 ChatGPT 还可辅助用户查找音乐,简化搜索与选择流程。

6、Gemini预测市场全美上线: 50 州用户可实时交易现实事件,免手续费限时开放

Gemini 已将预测市场产品 Gemini Predictions 推向全美,覆盖美国 50 个州。该产品允许用户围绕真实世界事件开展预测性交易。

平台基于合规框架搭建,采用链下撮合、链上结算的机制,以兼顾交易速度和透明度。为吸引更多用户参与,Gemini 还推出了限时零手续费活动。

【提要:】

🌍 Gemini Predictions 在全美上线,覆盖所有50个州,用户可实时交易现实事件。

🔒 平台运行在合规框架下,并通过相关机制保证交易环境和结果透明。

💰 限时免手续费活动有助于提升用户参与度,并对现有预测市场平台形成竞争。

7、Adobe Firefly视频功能大升级:支持精准提示编辑、集成FLUX.2与Astra,告别“重做整段视频”时代

Adobe Firefly 的视频功能迎来重要更新。新版本增加了基于文本提示的精准局部修改能力,用户无需反复重做整段视频,也能对画面细节进行调整。

此次更新还整合了多个第三方模型,以提升创作自由度和画质表现。同时,新功能加入可视化时间轴界面和相机运动迁移能力,为短视频创作者提供更接近电影级运镜的生成效果。

【提要:】

🔥 新增基于文本提示的局部精准修改功能,提升视频创作效率。

🖼️ 集成 Black Forest Labs 的 FLUX.2 图像模型,用于增强生成质量。

🎥 支持相机运动迁移,帮助实现更具电影感的镜头运动。

8、谷歌实验室推出 AI 助手 CC:集成 Gemini 技术,打造智能“日程管家”

谷歌实验室推出全新 AI 助手 CC。该助手基于 Gemini 技术,并深度整合谷歌生态系统,目标是帮助用户自动整理日程并管理任务。


image.png

【提要:】

📅 CC 是一款基于 Gemini 技术的 AI 助手,面向日程梳理和任务管理场景。

📧 CC 可整合 Gmail、谷歌日历和谷歌云端硬盘等工具,并生成“您的一天预览”简报。

💡 用户能够通过回复邮件或发送自定义请求来指导 CC,使其逐步理解个人偏好。

一句话总结

从图像、视频到实时交互世界和开源大模型,本期 AI 动态显示出生成式 AI 正在继续向更高效率、更强交互和更低使用门槛推进。