欢迎阅读本期【AI日报】。今天的内容涵盖视频生成、语音合成、大模型、图像生成、具身智能训练平台,以及 AI 手机应用能力等多个方向的新进展。

新鲜AI产品点击了解https://app..com/zh

今日重点

可灵 AI 发布「主体库」,为 O1 多模态视频模型补上长期记忆能力,重点改善角色一致性;阿里巴巴上线 Qwen3-TTS,支持 49 种音色、10 种语言和 9 种中国方言;腾讯、美团、京东云、英伟达、微博和微软也分别在大模型、图像生成、具身智能、AI 手机与实时语音模型方面带来更新。

1、可灵 AI上线主体库:模型加入记忆能力,角色不再频繁“变脸”

可灵 AI 推出「主体库」功能,用于增强 O1 多模态视频模型的长期记忆能力,主要解决视频生成中角色不稳定的问题。官方表示,角色一致性可提升至 96% 以上,从而减少 AI 视频里常见的“变脸”现象。用户只需上传一张角色图片,系统就能生成 3D 视角补全和多光线变体,并支持在不同场景中直接调用。


image.png

【提要:】

✨ 主体库采用上传、补全、调用三步流程,目的是提高角色一致性

🎨 AI 智能描述可自动提取关键词,帮助提升生成成功率

🚀 主体库与 O1 模型共用统一入口,串联文本、图像和视频生成流程

2、阿里 Qwen3-TTS 登场:49 种音色 + 10 种语言 + 9 种方言,语音生成表现领先

阿里巴巴正式上线 Qwen3-TTS。该模型支持零样本、多角色以及跨语言语音生成,在整体表现上优于主流商用引擎,可应用于教育、直播、客服等多类场景。

【提要:】

🎧 提供 49 种高品质音色,适配多样化使用需求

🌐 覆盖 10 种语言和 9 种中国方言

📉 WER 表现明显优于主流商用模型

详情链接:https://modelscope.cn/studios/Qwen/Qwen3-TTS-Demo

3、406B参数空降!腾讯混元2.0发布,推理性能自称“国内第一梯队”

腾讯发布新一代自研大模型混元 2.0,包含 Think 和 Instruct 两个版本,分别侧重推理能力与指令遵循能力。该模型在数学、科学、代码等复杂任务中表现突出,目前已接入腾讯云 API,并已在部分应用中落地。

image.png

【提要:】

🧠 混元 2.0 采用 MoE 架构,推理速度提升 40%

📊 Think 版在 IMO 和哈佛-MIT 竞赛中的准确率分别达到 83.1% 和 81.7%

💰 腾讯云 API 定价为 GPT-4o 的 45%,并支持企业私有化部署

4、美团开源 6B 参数图像生成模型 LongCat-Image,中文文字生成与图像编辑达到开源 SOTA

美团 LongCat 团队推出并开源 LongCat-Image 图像生成模型。该模型参数规模为 6B,在保持较低使用门槛的同时实现了较高性能,尤其在中文文字生成和图像编辑任务上表现突出,达到开源 SOTA 水平。LongCat-Image 通过系统性的训练策略和数据工程优化,即使面对多样化指令也能保持较好的执行效果与准确性。团队希望借助开源方式构建透明、开放、协作的生态,吸引开发者参与使用和共建。


image.png

【提要:】

🧠 LongCat-Image 在图像编辑方面达到开源 SOTA,具备较强的指令遵循和视觉一致性能力

🖋️ 模型针对中文文字生成做了优化,可支持复杂笔画结构汉字渲染

🎨 LongCat 团队通过开源推动透明、开放的生态建设,鼓励开发者参与模型共建与使用

详情链接:https://longcat.ai/

5、京东云JoyBuilder支持GR00T N1.5千卡训练,推动具身智能规模化落地

京东云 JoyBuilder 平台在完成全栈优化后,已经成功支持 GR00T N1.5 千卡级训练。平台训练效率提升 3.5 倍,有助于推动具身智能训练向更大规模落地。

【提要:】

🧠 京东云 JoyBuilder 平台完成关键升级,成功支撑 GR00T N1.5 千卡级训练

🚀 平台训练效率提升 3.5 倍,加快具身智能规模化落地

🌐 支持最新 LeRobot 训练数据协议,体现行业领先性

6、英伟达4B小模型逆袭!单任务成本仅为 GPT-5 Pro 的 1/36

英伟达 4B 小模型 NVARC 在最新 ARC-AGI2 评测中取得 27.64% 的成绩,并击败 GPT-5 Pro,显示出性能与成本上的双重优势。NVARC 采用零预训练方法和合成数据生成策略,增强了模型对新任务的适应能力和运行效率。

image.png

【提要:】

🧠 NVARC 使用零预训练深度学习方法,降低对传统大规模数据集的依赖

💡 NVARC 借助 GPT-OSS-120B 生成高质量合成谜题,减少实时计算资源需求

🚀 NVARC 的 TTFT 技术可帮助模型更快适配新任务规则,提高效率

7、微博 CEO 回应 AI 手机能自主发微博:仍需用户确认

微博 CEO 王高飞回应了豆包 AI 手机是否可以自主发微博的问题。他表示,该能力已经具备,但依然需要用户确认。与此同时,豆包 AI 手机在部分主流应用中遇到登录问题,也引发了外界对 AI 操作边界的讨论。王高飞还提到,一些游戏类应用可以识别 AI 控制行为,并对 AI 助手的使用进行限制。

【提要:】

🤖 微博 CEO 王高飞表示,AI 手机自行发微博已有相应能力,但仍需用户确认

📱 豆包 AI 手机在主流应用中遇到登录限制,引发对其操作能力的讨论

⚙️ 目前 AI 助手在部分应用中仍需手动操作,体现出技术发展中的限制与挑战

8、微软推出 VibeVoice-Realtime:实时文本转语音新模型,面向互动式应用

微软发布 VibeVoice-Realtime-0.5B,这是一款轻量级实时文本转语音(TTS)模型,支持流式文本输入和长篇语音输出。该模型可在 300 毫秒内开始生成语音,适合代理式应用和实时数据讲述等交互场景。模型采用交错窗口设计,以降低延迟并提升语音合成质量,在 LibriSpeech 测试中的字错误率为 2.00%。

【提要:】

🌟 支持流式文本输入,可在 300 毫秒内开始输出语音,适合实时交互应用

🛠️ 使用低延迟声学标记器,以 7.5 赫兹速度生成声学特征,优化长篇语音合成

📈 在 LibriSpeech 测试中,VibeVoice-Realtime 字错误率为 2.00%,可适用于多种场景

详情链接:https://huggingface.co/microsoft/VibeVoice-Realtime-0.5B

一句话总结

本期 AI 日报的重点集中在多模态生成、语音合成、模型推理和具身智能训练能力的升级,多家厂商也在从模型能力、应用入口与部署成本等维度推动 AI 产品落地。