欢迎收看【AI日报】。这里持续整理人工智能领域的最新动向,关注开发者生态、前沿技术走向以及创新型 AI 产品应用。

新鲜 AI 产品点击了解https://app..com/zh

今日重点

本期 AI 日报涵盖多项值得关注的进展:爱诗科技推出通用实时世界模型 PixVerse R1,Vidu 上线 AI 一键生成 MV 功能,MiniMax 发布 OctoCodingBench 编程智能体基准测试;与此同时,可灵AI披露 ARR 达 2.4 亿美元,智谱 AI 与华为联合开源 GLM-Image,医疗、电商等垂直场景也迎来多款 AI 产品和模型更新。

1、爱诗科技发布全球首个通用实时世界模型 PixVerse R1,最高1080P 画质

爱诗科技正式发布全球首个通用实时世界模型 PixVerse R1。该模型围绕实时交互体验构建,依托三项核心技术能力支撑虚拟世界生成与交互,并面向游戏、影视、直播等场景,探索“人人可共创”的内容生产方式。

image.png

【提要:】

🧠 Omni 原生多模态模型被视为现实世界的“计算基座”,可将多模态内容统一为连续 Token 流,生成符合物理逻辑的数字世界。

🔄 自回归流式生成机制有助于提升长时序内容的一致性,支持叙事层面的“流式交互”。

⚡ 瞬时响应引擎 IRE 优化计算效率,为“即时响应”体验提供支撑。

2、Vidu 发布 AI 一键生成 MV 功能,打造分钟级“虚拟制片厂”

Vidu 推出 AI 一键生成 MV 功能,进一步推动视频创作流程向端到端自动生成演进。用户只需输入背景音乐、参考图像和文本指令,系统即可在分钟级生成高质量 MV。该功能依托多智能体系统完成流程协同,降低专业视频制作门槛,为创作者带来类似“虚拟制片厂”的一体化创作体验。

image.png

【提要:】

🎬 全自动多智能体协同:内置导演、分镜、视觉生成和剪辑四类智能体,覆盖从音乐解析到成片输出的完整流程。

🖼️ 工业级风格一致性:最多支持 7 张参考图定位,帮助长达 5 分钟的视频保持角色与场景风格稳定。

🎵 音画同步精准卡点:AI 可识别背景音乐节奏并完成转场,同时生成逐帧同步的动态字幕,实现分钟级交付。

3、编程智能体的新标准!MiniMax 发布 OctoCodingBench 基准测试

MiniMax 发布开源基准测试 OctoCodingBench,主要用于评估编程智能体在代码仓库环境中的指令遵循能力。该基准围绕七类不同指令来源设计测试任务,提供多维度评估框架,并采用二元检查清单评分机制,以提高评估结果的准确性。OctoCodingBench 还支持 Claude Code、Kilo、Droid 等多个脚手架环境,这些工具已应用于实际生产场景。

【提要:】

🧠 面向编程智能体的指令遵循能力评估。

📊 构建多维度评估框架,覆盖不同指令来源。

🔧 支持多个脚手架环境,贴近真实代码生产流程。

详情链接:https://huggingface.co/datasets/MiniMaxAI/OctoCodingBench

4、快手宣布可灵AI ARR达2.4亿美元,12月收入超过2000万美元

快手科技披露,可灵AI在 2025 年 12 月实现单月营收超过 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。该数据反映出可灵AI在生成式 AI 市场中的商业化增长态势。

【提要:】

🚀 可灵AI月收入突破 2000 万美元,年化收入运行率(ARR)达到 2.4 亿美元。

🛠️ 持续进行技术密集迭代,推出多款模型以提升专业创作效率。

🌍 服务全球超过 6000 万用户,商业化落地覆盖多个领域。

5、国产算力+自主创新架构!智谱联合华为开源GLM-Image,首个多模态SOTA模型全链路跑通昇腾芯片

智谱 AI 与华为联合开源 GLM-Image。该模型达到国际领先水平,并创下全球首个全流程基于国产 AI 芯片运行的多模态大模型纪录。GLM-Image 采用自回归与扩散解码器结合的混合架构,实现图文语义深度对齐和联合推理,推动 AIGC 从“像素堆砌”走向“语义驱动”。

image.png

【提要:】

🧠 采用自回归+扩散解码器混合架构,实现图文语义深度对齐与联合推理。

🚀 全流程基于国产 AI 芯片完成,降低对国外 GPU 的依赖。

🌐 推动 AIGC 从“像素堆砌”迈向“语义驱动”。

详情链接:https://github.com/zai-org/GLM-Image

6、全球首款医疗大模型 Baichuan-M3 亮相:超越 GPT-5.2,实力不容小觑!

百川智能发布国产医疗大模型 Baichuan-M3,并称其为全球最强的医疗 AI 系统。该模型面向医疗场景打造,融合大量医学文献、临床指南、真实病历以及药品知识库,在智能医疗应用中展现出较强能力。

【提要:】

🧠 Baichuan-M3 医疗大模型参数规模达到 2350 亿,并强调具备超低幻觉率,以保障医疗问诊和用药建议的准确性。

🏥 在问诊能力和医疗准确性方面,Baichuan-M3 被称超越 GPT-5.2,并优于人类医生。

🌐 百川智能通过开源策略鼓励开发者参与医疗 AI 创新,推动医疗 AI 生态共建。

7、谷歌重构电商未来:推出Agentic AI购物系统,Gemini CX+UCP协议实现“搜索即购买”

谷歌推出 Agentic AI 购物系统,将 Gemini CX 与 UCP 协议结合,试图打通从搜索到购买的购物流程,为用户提供更连贯的电商体验。

【提要:】

✅ 发布 Agentic 电商解决方案,涵盖 UCP 协议与 Gemini CX 系统,目标是实现一站式购物闭环。

💡 用户可通过谷歌搜索直接完成购物任务,减少页面跳转。

🌐 UCP 协议为 AI Agent、商家与电商平台建立标准化通信桥梁,并兼容现有行业标准。

8、谷歌加码医疗AI开源生态:MedGemma 1.5强化医学影像能力,同步推出语音转写模型MedASR

谷歌发布新一代开源医疗大模型 MedGemma 1.5,以及医疗语音识别模型 MedASR,继续完善其面向医疗垂直领域的技术布局。MedGemma 1.5 强化了医学影像理解与分析能力,从文本问答工具进一步扩展为多模态临床决策支持系统;MedASR 则聚焦医疗语音转写场景,用于提升电子病历录入效率。两个模型均基于去标识化临床数据训练,并以开源形式面向全球研究者和开发者开放。

image.png

【提要:】

🧠 MedGemma 1.5 强化医学影像理解与分析能力,支持多模态临床决策支持系统。

🗣️ MedASR 优化医疗语音识别能力,提高电子病历录入效率。

🔒 谷歌开源模型遵循隐私保护规范,推动 AI 在基层医疗和科研场景中的应用。

一句话总结

从实时世界模型、AI 视频创作到编程智能体评测、医疗与电商应用,本期动态显示生成式 AI 正在加速走向更具体的生产与商业化场景。