欢迎阅读本期【AI日报】。本期聚焦大模型、AI 编程、音乐与视频生成、多模态模型、安全治理及应用榜单,梳理近期人工智能领域的产品发布、技术更新与行业进展。

新鲜AI产品点击了解https://app..com/zh

今日重点

腾讯推出混元3D 3.0模型,并同步发布混元3D Studio平台及相关开源计划;昆仑万维旗下 AI 音乐创作平台 Mureka 上线 Agent Studio;阿里 Qoder 开启付费订阅,向开发者提供更高使用额度和进阶能力。

关键信息

1、腾讯发布混元3D 3.0模型,建模精度提升3倍

在2025全球数字生态大会上,腾讯正式发布混元3D 3.0模型。该模型采用3D-DiT分级雕刻技术,进一步提升3D内容生成过程中的建模精度。与此同时,腾讯推出混元3D Studio平台,并公布相关开源计划,持续拓展3D创作工具和生成技术的应用范围。

核心信息:

🧠 混元3D 3.0引入3D-DiT分级雕刻技术,建模精度提升3倍。

🎨 混元3D Studio针对专业创作流程设计,有助于提高3D艺术创作的效率和质量。

🚀 腾讯计划开源混元3D omni模型,推动3D生成技术在学术研究及产业场景中的应用。

2、昆仑万维 Mureka 上线 Agent Studio,降低 AI 音乐创作门槛

昆仑万维旗下 AI 音乐创作平台 Mureka 推出「Agent Studio」功能。用户以自然语言描述创作意图后,AI 便可自动生成歌词和音乐。目前,该功能覆盖专辑制作、热点写歌、情感表达等多个场景,为不同创作需求提供更便捷的音乐生成方式。

image.png

核心信息:

🎧 Mureka 上线「Agent Studio」,普通用户也可以借助 AI 参与音乐创作。

🤖 输入简单的创作想法后,AI 能够生成完整歌词和音乐。

🎶 当前功能包含六个创作场景,涉及专辑制作、热点写歌和情感表达等内容。

3、阿里 Qoder 开启付费订阅,Pro 版每月20美元

阿里 Qoder 正式推出付费订阅计划,包含 Pro 和 Pro+ 两个版本。订阅用户可使用无限代码补全、高级模型调用等功能,以提升 AI 编程效率。Qoder 同时调整了 Credits 消耗机制,并增强智能体工具的并行处理能力和工程检索准确率。

image.png

核心信息:

🔥 Qoder 的付费订阅包括 Pro 与 Pro+ 两个版本。

💡 Pro 版提供无限代码补全和2000 Credits,Pro+ 版提供6000 Credits及更多资源。

🚀 Credits 消耗机制得到优化,智能体工具并行化能力增强,并有助于减少 token 消耗。

4、VEED 发布 Fabric 1.0,可由单张图片生成“会说话”视频

VEED 推出 AI 视频生成工具 Fabric 1.0。用户提供一张静态图片和语音输入后,该工具即可生成高质量的会说话视频。在唇形同步、面部表情自然度及生成速度方面,Fabric 1.0均有较好表现,可减少视频制作所需的时间和成本,适用于多种内容创作场景。

核心信息:

🖼️ Fabric 1.0可以将静态图像转化为动态的会说话视频。

⏱️ 视频生成速度提升7倍,成本降低60倍,适合快速内容生产。

🌐 工具支持多语言和自动字幕功能,可改善全球用户的使用体验。

详情链接:https://www.veed.io/ai/fabric-1-0

5、OpenAI 推出 GPT-5-Codex,增强代理式编码能力

OpenAI 发布 GPT-5-Codex,继续拓展 AI 在代理式编码领域的应用。该模型支持动态思考,可依据任务复杂程度调整处理时间,并通过多平台集成,覆盖开发者工作流中的代码生成、代码审查和协作等环节。

image.png

核心信息:

🧠 GPT-5-Codex能够根据任务复杂度动态调整处理时间,提升编码效率。

💻 模型支持 IDE 扩展、Web 界面及 GitHub 代码审查等多平台集成。

🚀 开发者反馈显示,GPT-5-Codex有助于缩短开发周期、加快代码生成,并减少错误注释。

详情链接:https://openai.com/index/introducing-upgrades-to-codex/

6、《人工智能安全治理框架》2.0版发布,推进安全可信 AI 生态建设

《人工智能安全治理框架》2.0版于2025年9月15日正式发布,重点回应人工智能快速发展带来的新风险和新挑战。新版框架在1.0版基础上进行完善,结合实际应用进一步细化风险分类与防范措施,同时强调通过全球合作加强 AI 安全治理。

image.png

核心信息:

🔐 《人工智能安全治理框架》2.0版正式发布,回应 AI 技术演进带来的新挑战。

🔍 新版框架基于1.0版进行优化,进一步完善风险分类和防范措施。

🤝 框架强调全球合作,推动多边机制下的人工智能安全治理协作。

详情链接:https://www.cac.gov.cn/2025-09/15/c_1759653448369123.htm

7、OpenAI Evals 增加原生音频输入与评估功能

OpenAI 的 Evals 工具新增原生音频输入和评估能力。开发者现在可以直接上传音频文件进行性能测试,无需先把音频转换成文本,有助于提高语音识别和语音生成模型的测试效率与准确性。

核心信息:

🎧 原生音频输入简化了模型评估流程,有助于提升开发效率。

🔍 在不进行文本转录的情况下,也可以直接评估语音识别和语音生成模型的表现。

💡 该功能能够为智能语音助手和音频内容生成提供更精确的测试支持。

8、Mini-o3 开源模型实现超长视觉推理

Mini-o3 是字节跳动与香港大学联合推出的开源视觉推理模型。该模型支持进行数十轮视觉推理,相较于常见的1至2轮对话形式,复杂视觉问题的处理能力得到提升。其核心设计包括 VisualProbe 数据集、迭代数据收集流程以及超轮次掩码策略,为多轮视觉推理提供了新的技术路径。

image.png

核心信息:

🧠 Mini-o3支持数十轮视觉推理,突破以往1至2轮对话的限制。

📊 VisualProbe 数据集和迭代数据收集流程增强了模型的深度推理能力。

🔄 超轮次掩码策略用于优化训练效率,并提升模型在测试阶段的表现。

详情链接:https://arxiv.org/pdf/2509.07969

9、上海 AI Lab 推出 Lumina-DiMOO,探索多模态生成与理解

上海人工智能实验室联合多所高校推出新一代多模态生成与理解模型 Lumina-DiMOO。该模型采用全离散扩散架构,并结合对比学习技术,对文本、图像和音频等数据进行整合与对齐,在生成质量、运行效率和多场景适配方面展现出应用潜力。

image.png

核心信息:

🌟 Lumina-DiMOO 是新一代多模态生成模型,采用全离散扩散架构提升数据处理效率。

🛠️ 通过对比学习技术,模型能够实现文本、图像等多类数据的对齐与理解。

🚀 Lumina-DiMOO 在图像生成和理解方面表现突出,并能够适配多种应用场景。

详情链接:https://github.com/Alpha-VLLM/Lumina-DiMOO

10、腾讯 AI 绘画微调技术提升生成图像美感

腾讯推出新的 AI 绘画微调技术,目标是提升生成图像的真实感和美学评分。相关方法包括“Direct-Align”和“语义相对偏好优化”(SRPO),用于缓解奖励作弊及离线调整受限等问题,同时增强通过文本控制图像风格的能力。

image.png

核心信息:

🧠 “Direct-Align”技术用于减少梯度爆炸,提升模型优化能力。

🎨 “语义相对偏好优化”(SRPO)支持通过文本调节图像风格。

📈 实验结果显示,采用 SRPO 训练的模型在真实感和美学质量方面均有明显提升。

详情链接:https://arxiv.org/pdf/2509.06942

11、Meta AI 发布 MobileLLM-R1,面向边缘推理的轻量级模型

Meta AI 推出 MobileLLM-R1 系列轻量级边缘推理模型,参数规模覆盖140M至950M,主要面向数学、编码和科学推理任务。该系列模型在训练效率和性能方面优于部分同类模型,其中数学和编码相关任务的表现较为突出。

image.png

核心信息:

🧩 Meta AI 发布 MobileLLM-R1 系列轻量级边缘推理模型,参数规模为140M至950M。

📊 MobileLLM-R1仅使用约11.7%的数据完成训练,降低训练成本和资源需求。

💡 MobileLLM-R1-950M在多项基准测试中超过多款大型开源模型,数学和编码任务表现尤其突出。

详情链接:https://huggingface.co/facebook/MobileLLM-R1-950M

12、腾讯启动 AI 应用繁荣计划,超300家企业参与智能体赛道

腾讯在全球数字生态大会上发布 AI 应用繁荣计划,重点推动人工智能在垂直场景中的落地。该计划由 AI 共创营和 AI 百校行两大模块组成,吸引超过300家企业参与,并通过技术共享、资源开放和内容支持等方式,推进智能体与大模型应用孵化。

image.png

核心信息:

🌐 腾讯人工智能应用繁荣计划聚焦 AI 垂直场景落地,包含人工智能共创营和人工智能百校行两个核心模块。

🌐 首届线下活动吸引来自多个行业的近3000名参与者,显示出市场对大规模 AI 应用的需求。

🌐 腾讯将提供技术、资源和内容支持,协助合作伙伴推进 AI 解决方案商业化。


13、谷歌 DeepMind 发布具备差分隐私能力的 VaultGemma

谷歌 DeepMind 推出 VaultGemma,这是一款具备差分隐私能力的语言模型,重点关注用户数据保护。该模型基于 Gemma2 架构,采用多查询注意力机制,并通过加入随机噪声,降低模型输出与特定训练样本之间的关联。虽然整体性能相对保守,但 VaultGemma 在隐私保护方面提供了更强保障。

核心信息:

🔒 VaultGemma 是一款具备差分隐私能力的开源语言模型,参数规模为10亿。

🧠 模型采用仅解码器 Transformer 架构,序列长度限制为1024个 Token。

🌐 谷歌计划在 Hugging Face 和 Kaggle 上公开 VaultGemma 及其代码库,推动隐私安全与开源技术结合。

14、QuestMobile:豆包月活超过 DeepSeek,位居中国原生 AI APP 榜首

QuestMobile 发布的2025年8月 AI 应用行业月度报告显示,豆包月活用户达到1.57亿,环比增长6.6%,超过 DeepSeek,成为原生应用第一。腾讯元宝的增长同样明显,月活增速达到22.4%,位列原生应用第三。此外,TOP50 AI 应用中超过一半属于 In-App 插件应用,豆包还以 PC 客户端应用身份进入榜单,体现出跨端使用优势。

image.png

核心信息:

📱 豆包月活用户达到1.57亿,环比增长6.6%,超过 DeepSeek,成为原生应用第一

💻 腾讯元宝月活增速达到22.4%,位列原生应用第三,用户规模处于1000万至1亿之间。

🔄 TOP50 AI 应用中超过一半为 In-App 插件应用,豆包则以 PC 客户端应用进入榜单。

一句话总结

本期 AI 日报显示,国内外厂商持续加码3D生成、AI 编程、音乐与视频创作、多模态理解、隐私保护及行业应用落地,AI 产品化和场景化竞争正在进一步提速。