今日 AI 行业动态主要覆盖开放世界模型、3D 世界生成、语音合成、智能代理安全以及广电内容生产等方向。阿里巴巴 ATH 发布 Happy Oyster,Anthropic 被曝将推出 Claude Opus 4.7 与 AI 设计工具,腾讯混元团队开源混元3D世界模型2.0;谷歌、蚂蚁灵波科技、湖南广电、OpenAI 等也带来了模型、工具和应用层面的新进展。

新鲜AI产品点击了解https://app..com/zh

1、阿里巴巴 ATH 发布开放世界模型 Happy Oyster,实时交互体验申请已开放

阿里巴巴 ATH 团队推出了新的开放世界模型 Happy Oyster。该模型聚焦实时交互和内容创建场景,进一步完善了阿里在生成式 AI 方向的技术布局。与此同时,ATH 旗下 HappyHorse-1.0 模型在 Video Edit 方向排行榜中拿下全球第一,显示出其在多模态视觉处理任务上的竞争力。Happy Oyster 的发布也表明,生成式 AI 正从静态内容生成继续向动态、可交互的环境构建演进,相关能力可用于游戏开发、虚拟仿真、创意设计等应用场景。

QQ20260416-135915.jpg

【关键信息】

🧠 阿里巴巴 ATH 团队发布开放世界模型 Happy Oyster,主打实时交互与内容创建能力。

📊 HappyHorse-1.0 在最新 Video Edit 方向排行榜中获得 1299 分,位列全球第一。

🚀 Happy Oyster 代表生成式 AI 从静态生成迈向动态可交互环境的一类新趋势。

详情链接:https://www.happyoyster.cn/

2、Anthropic 或将推出 Claude Opus 4.7,并准备全新 AI 设计工具

Anthropic 即将发布 Claude Opus 4.7,同时还在筹备一款新的 AI 设计工具。相关消息引发市场关注,也显示 Anthropic 正持续扩展 Claude 模型能力以及面向实际应用的工具产品线。

image.png

【关键信息】

🧠 Claude Opus 4.7 被认为是 Claude Opus 4.6 的增量升级版本,重点可能包括编码能力增强与上下文窗口扩展。

🎨 Anthropic 正准备发布一款 AI 驱动的设计工具,潜在竞争对象包括 Gamma、Google Stitch 等产品。

💰 原文信息显示,Anthropic 估值已达到 8000 亿美元,年化营收从 90 亿美元升至 300 亿美元。

3、腾讯开源混元3D世界模型2.0,可一键生成可编辑 3D 空间资产

腾讯混元团队正式发布并开源“混元3D世界模型2.0”。这一版本在多模态世界模型能力上进行了升级,能够生成可交互、可编辑的 3D 资产,并支持多种格式导出以及与主流游戏引擎对接。该模型将空间理解、生成和重建流程进行统一,核心更新包括 HY-Pano-2.0 模型、自研空间 Agent 技术以及 WorldStereo 机制,可帮助降低游戏关卡原型设计、具身智能仿真环境搭建等工作的门槛。

image.png

【关键信息】

🧠 HY-World2.0 的能力从视频生成进一步拓展到可交互、可编辑的 3D 资产生成。

🚀 模型支持多种格式导出,并能够对接主流游戏引擎。

🌐 借助 SOTA 级空间一致性记忆机制,AI 驱动的 3D 内容创作正在向更实用的阶段推进。

4、谷歌推出 Gemini-TTS 文本转语音模型,覆盖近 70 种语言

谷歌发布 Gemini-TTS 文本转语音模型。该模型支持通过提示词控制语音情感、节奏和风格,让合成语音在自然度和细腻度上进一步提升。Gemini-TTS 还支持约 70 种语言,并具备自动识别语种的能力,可为多语言内容转语音提供更便捷的解决方案。

image.png

【关键信息】

✨ Gemini-TTS 可利用提示词调节生成语音的情感、节奏与风格。

🌍 模型支持约 70 种语言,并可自动识别语种,不需要手动进行语言标注。

🚀 与同系列音频模型结合后,有助于改善实时对话和多模态交互体验。

5、蚂蚁灵波科技开源 LingBot-Map,单摄像头实现实时流式三维重建

蚂蚁灵波科技开源了流式三维重建模型 LingBot-Map。该模型仅依赖一个普通 RGB 摄像头,就可以在视频采集过程中实时估计相机位姿,并完成场景三维结构重建。其能力可应用于机器人导航、自动驾驶、AR 硬件等领域,为终端设备提供连续、稳定且高效的在线建图能力。

image.png

【关键信息】

📱 只需一个普通 RGB 摄像头,即可实时估计相机位姿并重建三维场景结构。

🚀 模型采用流式处理架构,可在接收画面的同时输出定位与结构信息。

🌐 开源后有望降低高精度三维感知的硬件门槛,并推动具身智能设备发展。

详情链接:https://huggingface.co/robbyant/lingbot-map ModelScope:https://www.modelscope.cn/models/Robbyant/lingbot-map

6、芒果TV有效会员数突破 7560 万,自研大模型进入 30 多档节目生产

湖南广播电视台在第十三届中国网络视听大会上披露了 AI 转型相关进展。其中,芒果TV有效会员数量已突破 7560 万;湖南广电自研的芒果大模型也已经进入 30 多档节目的生产流程,并对节目制作效率带来明显提升。

【关键信息】

🍊 芒果TV有效会员数量突破 7560 万,体现其在流媒体市场中的持续竞争力。

🤖 湖南广电自研芒果大模型已孵化 80 余款智能体,并应用于 30 多档节目,生产效率提升 30% 以上。

💡 芒果TV 的 AI 转型呈现出可复制特征,展示了传统广电机构落地 AI 技术的一条实践路径。

7、超 20 万台 AI 服务器被指存在攻击风险,MCP 协议设计缺陷受关注

一份安全报告显示,Anthropic 的 MCP 协议存在严重设计缺陷,可能导致超过 20 万台 AI 服务器暴露在远程代码执行风险之下。问题主要来自 MCP SDK 的 STDIO 接口:该接口允许执行任何传入的操作系统命令,同时缺少必要的校验与警告机制。OX Security 已将相关问题通报给 Anthropic,但原文称 Anthropic 目前仅更新了安全文档,并未对架构进行调整,因此引发开发者担忧。

【关键信息】

🧠 MCP 架构设计缺陷可能带来远程代码执行风险,影响范围涉及超过 20 万台 AI 服务器。

🛡️ 漏洞关联 Anthropic 的 MCP 协议,并覆盖 11 种编程语言,潜在风险范围较广。

⚠️ Anthropic 目前仅更新安全文档,尚未进行架构层面的修改。

8、OpenAI 升级 Agents SDK,面向企业增强智能代理安全性

OpenAI 更新了 Agents SDK,旨在帮助企业更安全、更高效地构建智能代理。新版 SDK 引入沙箱能力,让智能代理可以在受控计算环境中运行,从而提升系统安全性。同时,新版本为开发者提供内置框架,支持在工作区内使用文件以及已获批准的工具,增强开发过程的灵活性。OpenAI 表示,相关新功能将通过 API 向所有客户开放,并采用标准定价。当前,新框架和沙箱功能将率先提供 Python 版本,TypeScript 支持会在后续版本中上线,未来还计划继续增加更多 Agent 功能。

image.png

【关键信息】

🛡️ OpenAI 更新 Agents SDK,并加入沙箱能力,以提高智能代理运行时的安全性。

🔧 新版 SDK 提供内置框架,可调用文件和已批准工具,提升开发灵活度。

📈 相关能力将通过 API 面向所有客户开放,Python 与 TypeScript 版本将陆续推进。

一句话总结

本期 AI 进展集中在开放世界模型、3D 世界生成、语音模型、智能代理安全和行业应用落地等方向,说明 AI 正从内容生成进一步延伸到交互式工具、空间资产生产与企业级工作流之中。