欢迎收看本期【AI日报】。今日内容主要覆盖 AI 音乐生成、世界模型、办公 Agent、多模态视频生成、工业大模型以及 AR 眼镜等方向,整理了近期值得关注的产品发布与技术进展。

新鲜AI产品点击了解https://app..com/zh

今日重点

MiniMax Music 2.5 已正式推出,重点提升 AI 音乐生成的可控性和真实感;蚂蚁灵波科技开源世界模型 LingBot-World,突出高保真、高动态和实时交互能力;谷歌 Gemini 3.5 的泄露信息则显示,其在代码生成与深度推理方面可能迎来新提升。

1、MiniMax Music 2.5 正式发布:攻克 AI 音乐“控”与“真”两大难题

MiniMax Music 2.5 的发布,进一步强化了 AI 音乐创作中的结构控制能力与声音真实度。新版本通过段落级强控制和物理级高保真技术,让创作者能够更精确地规划歌曲结构、风格和呈现方式。同时,产品也针对华语音乐场景做了优化,以提升中文演唱的自然度、流畅性和表现力。

image.png

【提要:】

🎵 全段落掌控:支持 14 种音乐结构标签,让 AI 音乐生成从偏随机输出转向更明确的指挥式创作。

🎤 真实人声质感:能呈现更细腻的转音与颤音,在男女对唱中体现更自然的协同和更丰富的和声层次。

🎹 专业级混音:内置百余种乐器音色,并具备随风格自动适配的混音能力,面向录音室级音频交付。

2、蚂蚁灵波开源世界模型 LingBot-World,高保真高动态,毫秒级实时交互

蚂蚁灵波科技开源了世界模型 LingBot-World。该模型在视频画面质量、动态表现、长时一致性和交互能力等方面表现突出,可用于构建高保真的数字演练环境,为具身智能、自动驾驶、游戏开发等场景提供支持。

image.png

【提要:】

🌍 LingBot-World 兼具高保真与高动态特性,支持 10 分钟连续稳定生成。

🕹️ 模型实现 16FPS 生成吞吐,并具备 1 秒内端到端交互延迟,可支持实时控制。

🔄 支持 Zero-shot 泛化能力,只需输入真实照片或游戏截图,就能生成可交互的视频流。

3、谷歌 Gemini 3.5 泄露:代号 Snow Bunny,单次提示可生成三千行代码

关于谷歌 Gemini 3.5 的泄露信息显示,其编程能力可能有明显提升,包括单次提示生成 3000 行代码,以及引入深度推理架构等能力。相关信息还提到多个专项模型,用于覆盖不同应用场景,显示出该系列模型在代码、逻辑推理和多模态创作方面的潜在能力。

【提要:】

🐰 Snow Bunny 计划:内部模型 Snow Bunny 被指具备较强应用构建能力,单次可产出 3000 行代码。

🧠 深度推理架构:引入“系统 2”思维和 Deep Think 切换开关,用于提升复杂逻辑问题的解决能力。

🚀 多模型协同:泄露信息中还提到 Fierce Falcon(速度与逻辑)和 Ghost Falcon(多模态创作)两款专项模型。

4、Kimi K2.5 Agent 助力高效办公:Excel、Word、PDF 全面升级

Kimi K2.5 的发布,让月之暗面旗下 Kimi Agent 在办公场景中的能力进一步增强。升级后的 Agent 不再局限于阅读和总结,还能深入处理 Excel、Word、PDF 和 PPT 等文件的核心任务,帮助用户生成更接近专业交付标准的办公成果。部分原本需要数小时甚至数天完成的机械性任务,也可以压缩到分钟级完成,并覆盖数据建模、智能审阅、视觉叙事等高阶场景。

image.png

【提要:】

📊 模型升级:依托最新Kimi K2.5,Agent 办公能力从“阅读总结”进一步升级为“核心创作与排版”。

💼 精通 Office:覆盖 Excel 数据建模、Word 审阅批注、PPT 逻辑生成以及 PDF 视觉设计等能力。

⚡ 效率平权:将数天级机械劳动缩短至分钟级,让非专业用户也能产出专业级办公文档。

5、工业AI新突破:蘑菇物联“灵知”垂直大模型通过国家网信办备案

蘑菇物联“灵知AI”垂直大模型已通过国家网信办生成式人工智能服务备案。该模型面向工业公辅能源领域,聚焦智能问答、精准预测、实时诊断和优化控制四类核心能力场景,体现出较强的行业专业性和落地实用价值。

【提要:】

🧠 智能问答:为复杂工业场景提供即时、专业的知识解答。

📈 精准预测:基于历史数据分析,预判设备运行趋势与能源消耗变化。

🔧 实时诊断:快速定位工业设备故障,提升运维与维护效率。

6、昆仑万维 SkyReels-V3 开源,实现多模态视频生成技术突破

昆仑万维开源 SkyReels-V3,推动视频生成技术继续向高保真和多模态方向演进。该模型通过单一建模架构,将参考图像转视频、视频延长和音频驱动虚拟形象三项核心能力整合到一起,面向更复杂的视频生成需求。

【提要:】

🎥 参考图像转视频(I2V)功能支持 1 至 4 张参考图输入,可较好保留主体身份特征与空间构图。

🎞 视频延长功能引入“镜头切换延长模式”,支持更具逻辑性的“叙事扩展”。

🎙 音频驱动虚拟形象模块实现极高口型同步率,支持分钟级长视频生成及多角色交互。

详情链接:https://github.com/SkyworkAI/SkyReels-V3

7、昆仑天工发布音乐大模型 Mureka V8:实现从“可生成”到“可发布”的跃迁

昆仑天工发布音乐大模型 Mureka V8,进一步提升 AI 音乐生成的成品质量。该模型基于 MusiCoT 技术体系,尝试更贴近人类音乐创作逻辑,在音乐性、编曲完整度、人声表达和音质质感等方面进行升级,推动 AI 音乐从“可生成”走向“可发布”。

image.png

【提要:】

🎵 技术突破:依托 MusiCoT 技术体系,对人类创作逻辑进行更深层建模。

🎹 成品级质感:在旋律、人声、编曲等维度全面升级,使作品更接近“可发布”水平。

🛠️ 创作协同:支持用户通过自然语言和参考素材持续调整迭代,而不是依赖随机生成结果。

详情链接:https://www.mureka.ai/ https://www.mureka.cn/

8、三星官宣:下一代 AR 眼镜将于 2026 年发布,主打多模态 AI

三星已正式确认,下一代 AR 眼镜将于 2026 年发布,并将多模态 AI 体验作为主要方向。该产品的核心卖点包括智能辅助、接近日常普通眼镜的轻便设计,以及面向 AR 场景的硬件配置。

【提要:】

🧠 智能辅助:结合语音、视觉及多种交互输入,提供沉浸式智能辅助服务。

👓 轻便设计:外观接近日常普通眼镜,强调佩戴舒适度。

⚙️ 硬件规格:搭载高通 AR1 芯片组,并配备 1200 万像素自动对焦摄像头。

一句话总结

本期 AI 日报显示,AI 正在从单点生成能力走向更强调可控性、实时交互、专业交付和行业落地的应用阶段。