欢迎关注【AI日报】。这里整理人工智能领域近期值得留意的动态,涵盖前沿模型、开源项目、AI 产品更新与商业化进展,便于开发者和行业读者快速了解技术走向与应用变化。
新鲜AI产品点击了解:https://app..com/zh
今日重点
本期看点包括:小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio;通义万相 Wan2.2-Animate 正式开源;Suno v5 音乐模型即将发布;生数科技完成数亿元融资;OpenAI 修复 ChatGPT 相关漏洞;谷歌将 Gemini 引入 Chrome;Luma AI 推出 Ray3;Mistral AI 发布 Magistral Small 1.2;Notion 上线 AI 智能体;腾讯混元 3D Studio 登场。
1、小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio
小米正式开源其首个原生端到端语音大模型 Xiaomi-MiMo-Audio,这也意味着小米在语音技术方向上迈出了重要一步。该模型采用新的预训练架构,并基于上亿小时训练数据构建,在少样本泛化能力方面表现突出,同时在多项评测基准中超过了部分闭源模型。

【提要:】
🧠 语音领域首次实现基于 In-Context Learning 的少样本泛化能力。
🚀 在音频理解基准 MMAU 和 Big Bench Audio S2T 任务中,表现超过 Google 和 OpenAI 的闭源模型。
🔧 开源内容覆盖完整语音预训练方案,包括 Tokenizer、模型结构、训练方法和评测体系。
详情链接:https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Instruct
2、通义万相全新动作生成模型 Wan2.2-Animate 正式开源
通义万相团队发布并开源了全新动作生成模型 Wan2.2-Animate。该模型在人像一致性和生成质量上进行了优化,并支持动作模仿与角色扮演两种模式,可应用于短视频创作、动漫制作等内容生产场景。

【提要:】
🎭 用户输入角色图片和参考视频后,模型可以将参考视频中的动作迁移到图片角色上。
🎭 在角色扮演模式下,模型能够把视频中的角色替换为指定图片角色。
🖼️ 模型引入独立的光照融合 LoRA,用于让光照效果融合得更自然。
详情链接:https://github.com/Wan-Video/Wan2.2
3、Suno v5 音乐模型即将登场,AI音乐创作迎来升级
Suno v5 音乐模型即将发布,被视为 AI 音乐创作领域的重要节点。随着新版本能力提升,人类作曲与机器生成音乐之间的界限预计还会进一步缩小。

【提要:】
🎧 Suno v5 音乐模型即将推出,受到全球关注。
💡 v5 将加入更先进的语义控制和多模态输入能力。
📈 v4.5 上线后,用户生成作品播放量已突破数亿次。
4、生数科技获数亿元融资,视频生成持续升温
生数科技在多模态 AI 方向持续推进,并已完成数亿元融资。其 Vidu 视频大模型也在商业化方面取得进展。未来,视频生成技术有望继续影响多个行业的内容生产方式,但版权和虚假信息治理等问题仍然需要重视。
【提要:】
🎥 生数科技完成数亿元 A 轮融资,多模态 AI 领域再添新进展。
💼 Vidu 视频大模型实现 2000 万美元年收入,并已进入多类商业化应用场景。
🌐 视频生成技术有望重塑全球数字内容生产流程,同时也面临版权治理等挑战。
5、OpenAI 修复 ChatGPT 漏洞,防止 Gmail 数据被盗取
网络安全公司 Radware 发现,ChatGPT 的“深度研究”功能此前存在严重漏洞。攻击者可能借助特制邮件诱导 ChatGPT 在处理用户 Gmail 查询时,将敏感信息发送到恶意网站。OpenAI 已经迅速完成修复,并表示模型安全始终是其优先事项。
【提要:】
📧 ChatGPT 漏洞可能被黑客利用,通过特制邮件窃取用户 Gmail 数据。
🔒 OpenAI 已快速完成漏洞修复,并重申对用户信息安全的重视。
🛡️ 此类攻击不容易被常规安全防护识别,用户仍需保持警惕。
6、谷歌将 Gemini 引入 Chrome,增强智能浏览体验
谷歌正在把 Gemini 集成到 Chrome 浏览器中,以提升用户体验并回应市场竞争。Gemini 可帮助用户理解网页内容、跨标签页操作以及安排任务,同时还会与谷歌旗下多个应用深度联动。企业用户也将获得数据保护和代理功能等支持。

【提要:】
🌐 谷歌在 Chrome 中整合 Gemini,进一步提升智能搜索体验。
📅 Gemini 支持网页内容理解、跨选项卡工作以及任务安排。
🔒 企业用户也可使用 Gemini 提供的数据保护与代理功能。
7、Luma AI 发布 Ray3:以“推理”能力革新视频生成,支持16位色深
Luma AI 推出 Ray3 视频生成模型。该模型具备 HDR 能力,并强调“推理”能力,可为视频创作带来新的工作方式,同时支持更高精度的视觉控制,并能与专业制作流程更好地结合。
【提要:】
🎥 Ray3 支持生成 10 位、12 位乃至 16 位色深视频,并可导出 EXR 文件格式,便于接入专业工作流。
🧠 Ray3 具备“推理”能力,可理解复杂指令并自我评估输出质量,从而进行视频迭代优化。
🖌️ 用户还可以通过图像绘制草图来控制视频内容,获得更灵活的创作自由度。
8、法国AI公司 Mistral 推出开源推理模型 Magistral Small 1.2
法国公司 Mistral AI 发布了最新开源推理模型 Magistral Small 1.2。该模型参数规模为 24B,并以 Apache2.0 开源许可发布。新版本支持最高 128k 上下文处理,引入 [THINK] 特殊 token,以增强模型表达力和灵活性。同时,Magistral Small 1.2 还增加了视觉编码器,并兼容多种框架,方便开发者使用。
【提要:】
🧠 Magistral Small 1.2 是一款 24B 参数开源推理模型,采用 Apache2.0 许可协议发布。
🔍 新版本加入 [THINK] 特殊 token,提升模型表达能力和灵活性。
🖼️ 新增视觉编码器,使其在图像与文本综合任务中更具优势。
9、Notion 发布AI智能体,可自动生成会议笔记、竞品分析,20分钟处理数百页文档
Notion 推出首个 AI 智能体,可将用户的 Notion 页面和数据库作为上下文,自动生成会议笔记、分析报告、竞品评估等内容。该智能体还支持创建或更新页面和数据库,并能通过外部平台触发操作。个性化设置也是其重要功能之一,用户可以为智能体设置档案页面,用来指定引用来源方式、输出风格等行为规则。

【提要:】
🧠 AI 智能体可自动生成会议笔记、分析报告和竞品评估。
🔄 支持从 Slack、邮件、Google Drive 等外部平台触发智能体操作。
📝 用户可自定义智能体档案页面,用于指导其行为和输出风格。
10、腾讯混元3D Studio 登场,3D创作效率提速至分钟级
腾讯混元 3D Studio 的发布,为 3D 创作效率提升提供了新的 AI 工具支持。该平台面向设计师、游戏开发者和建模师等群体,可作为 AI 工作台使用,帮助缩短 3D 资产生产周期。

【提要:】
🧠 原生 3D 分割算法可自动拆分模型部件,支持对角色配饰和服装进行独立编辑。
🎨 AI 语义 UV 展开技术可在 1-2 分钟内生成符合美术标准的 UV 图,提高制作效率。
🔧 智能材质编辑支持通过文本或图片输入生成高质量 PBR 质感纹理,实现更精准的材质控制。
详情链接:https://3d.hunyuan.tencent.com/studio
一句话总结
本期 AI 动态显示,开源模型、视频与音乐生成、智能体和 3D 创作工具都在同步加速,AI 应用正从单点能力展示进一步走向生产流程和商业场景落地。
