欢迎阅读【AI日报】。本栏目持续追踪人工智能行业新动态,覆盖技术突破、产品更新与产业落地,帮助开发者及 AI 关注者快速掌握值得关注的趋势变化。

新鲜 AI 产品点击了解https://app..com/zh

今日重点

本期 AI 日报关注视频生成、具身智能、车载 AI、AI 教育和影视产业等多个方向。火山引擎正式开放 Seedance 2.0 系列 API,Skywork AI 推出 Matrix-Game 3.0,阿里巴巴高德具身业务部首款四足机器人也首次曝光。

1、火山引擎 Seedance 2.0 系列 API 正式上线,开放全球 SOTA 级视频生成能力

火山引擎 Seedance 2.0 系列 API 服务已正式发布上线,面向视频生成场景提供全球 SOTA 级能力支持。该系列可处理多模态输入,在复杂内容场景中提升生成可用率,同时配套建设更完善的合规机制,推动 AI 视频创作能力在更多业务场景中实现商业化应用。

【提要:】

🧠 支持文字、图片、音频和视频四类模态混合输入,强化多模态参考与内容编辑能力。

🔒 建立覆盖全流程的肖像与版权安全标准,为合规创作提供基础保障。

🚀 Seedance 2.0 商业化上线,标志着视频生成技术正从能力展示加速迈向生产力工具。

2、AI 交互新突破:Skywork AI 发布 Matrix-Game 3.0,实现 720p 40 帧实时高清“世界生成”

Skywork AI 团队发布 Matrix-Game 3.0 系统,在交互式世界模型领域带来新进展。该系统支持 720p 高清实时视频生成,并针对 AI 视频生成过程中长期记忆能力不足的问题提出改进方案。

image.png

【提要:】

🧠 引入相机感知的记忆检索机制,用于缓解 AI 视频生成中的“失忆”问题。

🎮 基于虚幻引擎 5 打造 Unreal-Gen 平台,可生成电影级交互视频内容。

⚡ 结合多段自回归蒸馏策略与 VAE 解码器剪枝技术,进一步提升解码效率。

详情链接:https://arxiv.org/pdf/2604.08995

3、“嘿,Grok!”特斯拉 2026 春季更新炸场:FSD 一键订阅,车载 AI 迎来语音时代

特斯拉 2026 年春季软件更新带来多项关键升级,包括 Grok 语音助手能力增强、FSD 支持一键订阅和数据透明化,以及 Model 3/Y 可视化体验改进。这些变化显示,汽车正继续向智能移动终端方向演进。

image.png

【提要:】

🧠 Grok 支持“嘿”语音唤醒,提升车载 AI 助手的交互便捷性。

🚗 FSD 新增一键订阅与数据透明化能力,优化自动驾驶功能的使用流程。

📱 Model 3/Y 可视化表现升级,增强车辆界面的科技感与用户体验。

4、AI 正式纳入教资考试与公共必修课:五部门联合部署,开启全民智能素养培育时代

五部门联合印发《“人工智能+教育”行动计划》,对人工智能人才培养和教育应用创新作出系统部署。计划提出,到 2030 年将形成更深入的人工智能与教育融合格局,并建设覆盖全学段、面向全社会的通识教育体系。文件同时明确人才培养、深度融合、基础设施建设和开放生态四项核心战略任务。

【提要:】

🧠 人工智能课程将被纳入基础教育和高等教育体系。

💻 推动 AI 技术贯穿教育全过程,带动教学、学习和管理环节升级。

🌐 建设开放生态,推动中国标准走向国际。

5、AI 电影时代倒计时!爱奇艺龚宇:3 至 6 个月内或产出 AI 商业大片

爱奇艺 CEO 龚宇在《人民日报》发表文章,分析 AI 技术对影视行业产生的深层影响。他预计,未来 3 至 6 个月内,可能会出现真正意义上的 AI 商业大片。同时他也强调,在影视创作中,人文价值依然具有不可替代性。

【提要:】

🎬 AI 技术正在影响影视制作全链条,行业正接近商业化落地阶段。

🎡 爱奇艺正在探索数字 IP 实体化,其首家乐园已在江苏扬州开业。

💡 技术是工具,艺术是灵魂,创意和情感仍是影视作品的核心。

6、阿里巴巴首款具身机器人曝光:高德具身业务部将发布四足机器人

阿里巴巴高德具身业务部首款四足机器人曝光,显示其在具身智能方向取得重要进展。高德通过自研模型增强具身导航与操作能力,并计划将“空间智能”进一步转化为“具身应用”,以此在机器人赛道形成差异化竞争优势。

【提要:】

🤖 阿里巴巴高德具身业务部将发布首款四足机器人,体现其在具身智能领域的关键推进。

🧭 高德依托自研模型“ABot-N0”和“ABot-M0”,实现全球首个具身导航与操作的“双 SOTA”表现。

🌐 阿里巴巴将“空间智能”延展到“具身应用”,通过“导航+具身”打造独特竞争力。

7、研究人员推出 LPM1.0 模型:实现单图转实时交互式数字人视频

LPM1.0 模型在多模态处理方面带来突破,可根据单张参考图像实时生成包含说话、聆听、唱歌等行为的人物视频。该模型还支持接入主流语音 AI,从而提升交互式数字人的实时反馈体验。

image.png

【提要:】

🎭 LPM1.0 能通过单张参考图像实时生成人物视频,覆盖说话、聆听和唱歌等行为。

🎙️ 模型可与主流语音 AI 集成,实现带视觉反馈的实时交互。

🔄 支持流式传输技术,有助于保持系统稳定,并适配多种风格的视频生成需求。

8、谷歌 Gemini 推出基于 Nano Banana 技术的交互式可视化图像生成功能

谷歌 Gemini 借助 Nano Banana 技术推出新的 AI 图像生成体验,带来交互式可视化功能,使用户能够以更直观的方式理解复杂主题。不过,该功能目前仅面向专业版用户开放,并且暂不支持保存生成内容。

【提要:】

🧪 谷歌 Gemini 推出基于 Nano Banana 技术的交互式图像生成功能,将体验从静态图像扩展到动态交互模拟。

🔄 用户可通过滑块调整轨道速度、切换观察视角,或手动拆解机械步骤,更直观地理解复杂逻辑和物理过程。

🌐 该功能目前仅向 Gemini 专业版用户开放,教育版和工作区账户暂不支持,后续是否迭代尚未明确。

一句话总结

从视频生成 API 商业化、实时交互世界模型,到具身机器人、车载 AI 和教育政策推进,AI 正在持续从技术展示走向真实产业和日常应用场景。