欢迎阅读本期【AI日报】。今天的看点包括 OpenAI 新图像模型 GPT Image 1.5、腾讯混元世界模型 1.5、小米开源 MiMo-V2-Flash,以及字节跳动、Apple Music、Gemini、Adobe Firefly 和谷歌实验室带来的最新 AI 进展。
新鲜AI产品点击了解:https://app..com/zh
今日重点
本期 AI 资讯主要围绕生成式模型、实时交互世界、开源大模型、音视频创作和智能助手展开。OpenAI 升级了图像生成能力,腾讯推出可实时探索的混元世界模型,小米则以 MIT 协议开源 MiMo-V2-Flash,进一步推动高性能模型的开放落地。
1、OpenAI 推出全新图像生成模型 GPT Image 1.5,性能显著提升!
OpenAI 发布新一代图像生成模型 GPT Image 1.5。相比之前版本,该模型在图像生成和编辑能力上均有提升,能更准确地理解并执行用户指令,同时尽量保留原图中的关键内容。针对 AI 绘图中常见的文字呈现问题,GPT Image 1.5 也对文本渲染进行了优化。
此外,OpenAI 还强化了安全与合规相关团队,以确保生成内容在伦理和法律层面更符合要求。

【提要:】
🌟 GPT Image1.5 在图像生成与编辑方面完成升级。
🖼️ 用户可通过 ChatGPT 创建和编辑图像,体验更接近专业工具的处理效果。
🔒 OpenAI 配备专门安全团队,推动生成内容符合伦理与合规要求。
2、腾讯发布混元世界模型 1.5,开启实时交互的虚拟世界
腾讯正式推出混元世界模型1.5(Tencent HY WorldPlay)。据介绍,这是国内首个开放的实时互动体验平台,用户可以通过文字或图片快速生成具有差异化的互动世界,并在其中进行实时探索。
该模型主打实时交互、长范围 3D 一致性和多样化互动体验。腾讯还首次开源了业内较为全面的实时世界模型训练体系,为 AI 生成内容在互动场景中的发展提供了新的可能。

【提要:】
🕹️ 支持实时交互生成,可按24帧每秒生成720P高清视频。
🌐 强调长范围 3D 一致性,以保持场景的连续与稳定。
🔧 首次开源相关训练体系,为 AI 生成内容提供更多探索空间。
详情链接:https://3d.hunyuan.tencent.com/sceneTo3D?tab=worldplay
3、小米开源3090亿参数MiMo-V2-Flash大模型,推理速度碾压主流竞品,API低至0.1美元/百万Token
小米正式进入高性能开源大模型领域,发布基础语言模型 MiMo-V2-Flash,并以 MIT 协议开放模型权重和推理代码。该模型以“超高速、高效率”为主要特征,在推理、代码生成和智能体任务中都有较突出表现。
根据原文信息,MiMo-V2-Flash 的实测响应速度超过豆包、DeepSeek、元宝等热门国产模型,因此引发了开发者社区关注。
【提要:】
🧠 MiMo-V2-Flash 采用稀疏激活架构,总参数量达到3090亿,每次推理仅激活150亿参数,从而降低计算开销。
⚡ 在多项公开基准测试中,该模型表现优秀,尤其在多轮对话和复杂逻辑推理场景中具备速度优势。
💰 API 价格具有竞争力,每百万输入Token为0.1美元,输出Token为0.3美元,为中小企业和独立开发者提供低成本选择。
4、字节跳动发布 Seedance 1.5 Pro:AI 音视频创作进入 100% 视听同步时代!
字节跳动发布 Seedance 1.5 Pro,重点强化音视频联合生成能力。该产品被定位为推动 AI 音视频创作进入 100% 视听同步阶段,为创作者带来更丰富的视听内容生成体验。

【提要:】
🎥 支持通过文本或图像引导进行音视频联合生成。
🎬 强化视听同步能力,使角色口型、语调和表演节奏更好匹配。
🎭 支持多语种和方言,提升喜剧等风格化内容的表现力。
5、Apple Music 将与 ChatGPT 实现全新集成,用户可轻松创建歌单!
OpenAI 宣布 Apple Music 将与 ChatGPT 集成。集成完成后,用户可以通过自然语言指令创建歌单,也可以借助 ChatGPT 查找音乐,从而提升音乐服务的使用便捷性。

【提要:】
🎵 Apple Music 将接入 ChatGPT,支持用户更方便地创建歌单。
💬 用户可用自然语言描述需求,快速生成合适的播放列表。
🔍 ChatGPT 还可辅助用户查找音乐,简化搜索与选择流程。
6、Gemini预测市场全美上线: 50 州用户可实时交易现实事件,免手续费限时开放
Gemini 已将预测市场产品 Gemini Predictions 推向全美,覆盖美国 50 个州。该产品允许用户围绕真实世界事件开展预测性交易。
平台基于合规框架搭建,采用链下撮合、链上结算的机制,以兼顾交易速度和透明度。为吸引更多用户参与,Gemini 还推出了限时零手续费活动。
【提要:】
🌍 Gemini Predictions 在全美上线,覆盖所有50个州,用户可实时交易现实事件。
🔒 平台运行在合规框架下,并通过相关机制保证交易环境和结果透明。
💰 限时免手续费活动有助于提升用户参与度,并对现有预测市场平台形成竞争。
7、Adobe Firefly视频功能大升级:支持精准提示编辑、集成FLUX.2与Astra,告别“重做整段视频”时代
Adobe Firefly 的视频功能迎来重要更新。新版本增加了基于文本提示的精准局部修改能力,用户无需反复重做整段视频,也能对画面细节进行调整。
此次更新还整合了多个第三方模型,以提升创作自由度和画质表现。同时,新功能加入可视化时间轴界面和相机运动迁移能力,为短视频创作者提供更接近电影级运镜的生成效果。
【提要:】
🔥 新增基于文本提示的局部精准修改功能,提升视频创作效率。
🖼️ 集成 Black Forest Labs 的 FLUX.2 图像模型,用于增强生成质量。
🎥 支持相机运动迁移,帮助实现更具电影感的镜头运动。
8、谷歌实验室推出 AI 助手 CC:集成 Gemini 技术,打造智能“日程管家”
谷歌实验室推出全新 AI 助手 CC。该助手基于 Gemini 技术,并深度整合谷歌生态系统,目标是帮助用户自动整理日程并管理任务。

【提要:】
📅 CC 是一款基于 Gemini 技术的 AI 助手,面向日程梳理和任务管理场景。
📧 CC 可整合 Gmail、谷歌日历和谷歌云端硬盘等工具,并生成“您的一天预览”简报。
💡 用户能够通过回复邮件或发送自定义请求来指导 CC,使其逐步理解个人偏好。
一句话总结
从图像、视频到实时交互世界和开源大模型,本期 AI 动态显示出生成式 AI 正在继续向更高效率、更强交互和更低使用门槛推进。
