今日 AI 行业迎来多项更新:快手 Kwaipilot 团队推出 KAT 系列 Agentic Coding 大模型,腾讯发布“混元图像 3.0”,苹果则在开发一款类似 ChatGPT 的应用,用于验证新版 Siri 能力。此外,谷歌 Gemini、苹果 Manzano、YouTube Music、VideoFrom3D 以及 Moondream3.0 也分别在模型能力、产品体验和研究方向上带来新进展。

新鲜AI产品点击了解https://app..com/zh

1、快手推出 KAT 系列 Agentic Coding 大模型,强化代码智能能力

快手 Kwaipilot 团队发布 KAT 系列两款大模型,分别为 KAT-Dev-32B 和 KAT-Coder。两款模型均面向 Code Intelligence 场景,但产品定位有所区分:KAT-Dev-32B 面向开源模型需求,KAT-Coder 则作为闭源旗舰模型提供能力支持。在 SWE-Bench Verified 测试中,KAT-Dev-32B 解决率达到 62.4%,KAT-Coder 解决率达到 73.4%。

image.png

【提要:】

🧠 KAT-Dev-32B 是开源模型,SWE-Bench Verified 解决率达到 62.4%。

💻 KAT-Coder 定位为闭源旗舰模型,SWE-Bench Verified 解决率达到 73.4%。

🌐 KAT-Dev-32B 已在 Hugging Face 上线,KAT-Coder 可通过 StreamLake 平台获取 API 调用。

详情链接:https://kwaipilot.github.io/KAT-Coder/

2、腾讯发布“混元图像 3.0”,加码多模态生图技术

腾讯正式推出“混元图像 3.0”。这一版本被视为腾讯在多模态图像生成领域的重要升级,也进一步完善了其在 AIGC 技术体系中的布局。


image.png

【提要:】

🧠 混元图像 3.0 是首个开源的工业级多模态生图模型,具备较强语义解析能力。

🚀 3.0 版本在 2.0 基础上提升了模型复杂性与表现力,可实现毫秒级响应速度和超写实图像质量。

💡 腾讯混元系列已形成覆盖 3D 生成、定制化图像生成等方向的 AIGC 技术矩阵。

3、苹果开发类 ChatGPT 应用,用于验证新版 Siri

苹果正在研发一款类似 ChatGPT 的 iPhone 应用,主要用途是测试 Siri 的重大改版。该应用将帮助苹果验证 Siri 在个人数据搜索、任务执行等方面的能力,同时提升语音识别和语义理解表现,使交互更接近自然对话。

【提要:】

🍎 新版 Siri 将增强搜索和操作能力,例如查找歌曲、编辑照片等。

🤖 苹果正开发类似 ChatGPT 的应用,用于测试 Siri 的新功能。

📈 Siri 后续有望在语音识别和理解能力上进一步提升,带来更自然的对话体验。

4、谷歌更新 Gemini 2.5 Flash Lite,突出速度和效率优势

谷歌对 Gemini 系列大型语言模型进行了更新,其中 Gemini 2.5 Flash 与 Flash Lite 的速度和效率提升是本次重点。此次升级体现了谷歌在模型性能优化方面的持续投入,也为开发者提供了更具弹性的模型选择。

image.png

【提要:】

🌟 Gemini 2.5 Flash Lite 成为最快的专有模型,输出速度达到每秒 887 个 token。

🚀 新模型在输出质量和成本效率方面均有提升,其中 Flash Lite 减少了 50% 的输出 token。

🗣️ Gemini Live 更新强化了语音助手能力,提高函数调用准确性和自然对话表现。

5、苹果推出 Manzano 图像模型,兼顾理解与生成

苹果发布 Manzano 图像模型,目标是在同一模型内同时支持图像理解和图像生成能力,以缓解部分开源模型在两类能力之间难以兼顾的问题。Manzano 采用混合图像标记器来降低冲突,并在文本密集型任务中展现出较好表现。

image.png

【提要:】

🌟 Manzano 是一种新型图像模型,可同时支持图像理解与图像生成。

🔍 苹果研究显示,Manzano 在复杂文本任务中的表现接近商业系统水平。

⚙️ 该模型使用混合图像标记器,以减少图像理解和生成之间的冲突。

详情链接:https://arxiv.org/abs/2509.16197

6、YouTube Music 测试 AI 音乐主播,对标 Spotify AI DJ

YouTube Music 正在测试 AI 音乐主播功能,该功能可围绕用户正在播放的音乐提供歌曲背景、粉丝趣闻以及评论式解说。外界将其视为 YouTube Music 对 Spotify AI DJ 的回应,目标是提升用户听歌时的沉浸体验。

【提要:】

🎥 YouTube Music 正测试 AI 音乐主播,为用户补充音乐背后的故事和趣味内容。

🎧 Spotify AI DJ 已提供语音评论,YouTube Music 正通过类似功能参与竞争。

🌐 YouTube Labs 已向所有用户开放,但目前该测试仅面向部分美国用户。

7、VideoFrom3D:基于粗糙几何生成逼真 3D 场景视频

VideoFrom3D 是一个结合图像扩散模型与视频扩散模型的框架,能够根据粗糙几何生成真实感较强、风格一致的 3D 场景视频。该方法无需依赖成本较高的配对 3D 数据集,有助于简化设计流程、提升生成效率,并可用于复杂动态场景。

image.png

【提要:】

🧠 稀疏锚视图生成(SAG)模块利用图像扩散模型,基于参考图像和粗糙几何生成高质量、跨视图一致的锚视图。

🎥 几何引导生成插帧(GGI)模块使用视频扩散模型,在锚视图之间生成中间帧,使运动更流畅并保持时间一致性。

🚀 VideoFrom3D 不需要昂贵的配对 3D 数据集,可帮助设计师和开发者更高效地探索创意并产出高质量结果。

详情链接:https://kimgeonung.github.io/VideoFrom3D/

8、Moondream3.0 发布,多项基准测试表现超过 GPT-5 等模型

Moondream3.0 正式发布。该模型依托高效混合专家架构和轻量化设计,在视觉推理任务中取得突出表现。官方信息显示,Moondream3.0 在多项基准测试中超过 GPT-5、Gemini 和 Claude4 等顶级模型,并支持开放词汇物体检测、结构化输出等能力,可应用于安防监控、医学影像、文档处理等场景。其开源属性也让部署更为便利,尤其适合边缘计算环境。


image.png

【提要:】

🧠 Moondream3.0 采用高效混合专家架构,仅激活 2 亿参数,实现轻量化设计。

🔍 支持开放词汇物体检测与结构化输出,可适配多类复杂场景。

💻 开源设计便于部署,适合边缘计算,开发者可进一步调用其视觉能力。

一句话总结

本期 AI 日报显示,代码智能、多模态图像生成、语音助手、音乐体验以及 3D 视频生成等方向持续升温,科技公司和研究团队正推动 AI 能力进一步落地到更具体的应用场景中。