欢迎阅读本期【AI日报】。本期人工智能领域持续围绕多模态理解、实时翻译、AI 编程、电商交易与视频生成等方向更新,多家公司和团队带来了新模型、新功能及开源成果。

新鲜AI产品点击了解https://app..com/zh

今日重点

豆包大模型1.6-vision、DeepSeek V3.2-exp、Claude Sonnet4.5 和 GLM-4.6 等模型相继发布或亮相,升级重点涉及视觉理解、长上下文处理、代码生成与推理效率。同时,ChatGPT 上线“即时结账”,OpenAI 计划推出基于 Sora2 的社交应用,DeepMind 则提出“帧链”概念,AI 应用和视频理解能力继续拓展。

1、豆包大模型1.6-vision发布,综合成本较上一代下降约50%

豆包大模型1.6-vision 已正式发布。新版本进一步强化多模态理解和推理能力,并加入工具调用能力,同时通过性能优化提升开发效率与使用性价比。与上一代相比,其综合成本约降低 50%。

image.png

【提要:】

🧠 支持工具调用,有助于提升视觉理解准确性。

💻 针对应用开发场景优化,进一步提高开发效率。

💰 综合成本较上一代降低约 50%,使用成本更具优势。

2、通义千问推出 Qwen3-LiveTranslate-Flash,同传延迟低至3秒

通义千问发布 Qwen3-LiveTranslate-Flash 实时翻译系统,面向多语言音视频场景提供同声传译能力。系统支持 18 种语言及多种方言,并采用视觉上下文增强技术,以提升复杂语境下的翻译准确性。同传延迟最低可达 3 秒,表现优于多款主流模型。

image.png

【提要:】

🌍 覆盖 18 种语言和多种方言,适应更广泛的沟通场景。

🧠 借助视觉上下文增强技术,改善复杂场景中的翻译效果。

⏱️ 同传延迟最低可达 3 秒,提升实时交流的连贯性。

3、DeepSeek发布 V3.2-exp,稀疏注意力机制让 API 成本降低一半

DeepSeek 发布实验模型 V3.2-exp,采用“稀疏注意力”机制,重点降低长上下文任务中的推理成本。该模型还结合“闪电索引器”和“细粒度标记选择系统”,以提高长上下文片段的处理效率。初步测试显示,V3.2-exp 能够将 API 调用成本降低 50%。

QQ20250930-085622.png

【提要:】

⚡ 通过稀疏注意力机制优化长上下文处理。

🔍 “闪电索引器”与“细粒度标记选择系统”协同提升运行效率。

💰 初步测试显示 API 调用成本可下降 50%,有助于降低 AI 应用使用门槛。

4、Anthropic发布 Claude Sonnet4.5,编码与复杂任务处理能力增强

Anthropic 发布 Claude Sonnet4.5。该模型在编码任务和复杂任务处理方面表现突出,被认为是当前表现较强的编码模型之一。新版本整体性能继续提升,支持多平台使用,并进一步加强安全性与对齐能力。

image.png

【提要:】

✅ Claude Sonnet4.5 在编码基准测试中表现优异,可实现 30 小时以上的自主工作时长。

🔧 检查点、上下文编辑和内存工具等功能,进一步提升开发效率与实用性。

🔒 强化安全性并减少风险行为,适用于高风险企业场景。

5、ChatGPT上线“即时结账”,聊天窗口内即可完成购物

ChatGPT 推出“即时结账”功能,用户无需跳转外部链接或浏览器页面,即可在聊天界面完成单件商品购买。该功能由 OpenAI 与 Stripe 合作开发的“代理商务协议”提供支持,并兼容多种支付方式。后续,这项能力还计划扩展到多件商品购物车和国际市场。

【提要:】

💡 用户可通过 ChatGPT 的“即时结账”功能直接下单。

🔒 “代理商务协议”用于简化交易流程、保障交易安全,并支持多种支付方式。

🌐 后续将拓展至多件商品购物车和国际市场。

6、OpenAI计划推出 AI 版 TikTok,短视频内容由 AI 生成

OpenAI 即将推出一款基于 Sora2 模型的社交应用,外界将其称为“AI 版 TikTok”。该应用的形态类似 TikTok,平台内的视频内容均由 AI 生成,单条视频时长限制为 10 秒。应用支持用户身份认证和肖像使用,并针对安全与版权问题进行设计,以改善使用体验并减少用户流失。

【提要:】

🎥 Sora2 生成的视频单条时长限制为 10 秒,面向短视频传播场景。

🔒 用户可以完成身份认证,Sora2 可使用其肖像生成视频,其他用户也可标记使用。

🛡️ OpenAI 将发送提醒,确保用户了解肖像使用情况,并处理版权相关问题。

7、Claude Code 2.0升级,新增检查点功能与 VS Code 插件

Anthropic 发布 Claude Code v2.0,并同步更新 Claude Sonnet4.5 相关能力。新版本进一步提升 AI 在编程场景中的自主性和集成能力,围绕检查点机制、终端与 IDE 优化以及 API 扩展,为开发者提供更高效的编程支持。

image.png

【提要:】

✅ Claude Code v2.0 加入检查点功能,可自动保存状态并支持回滚,提升开发过程的安全性。

🔧 VS Code 原生扩展进入 beta 测试,支持内联差异预览和图形化交互。

📈 Sonnet4.5 在 OSWorld 基准测试中得分达到 61.4%,尤其适合构建复杂代理系统。

8、百度地图升级小度想想 2.0,出行助手支持更强智能服务

百度地图在第七届世界新能源汽车大会上发布小度想想 2.0。作为行业首个深度融合的端到端语音语言大模型,该版本面向用户提供更智能、个性化的出行服务。其核心能力包括接入地图出行知识库和实时搜索数据,增强对复杂出行意图的理解;构建跨端记忆体,实现手机、车机等设备之间的衔接;同时支持即时、近期和长期记忆,用于提供个性化推荐。

【提要:】

🚗 接入地图出行知识库和实时搜索数据,提升复杂出行意图的理解与推理能力。

📱 跨端记忆体支持手机、车机等多种设备之间的连续使用。

🧠 具备即时、近期和长期记忆能力,可提供个性化推荐服务。

9、蚂蚁集团开源万亿参数推理模型 Ring-1T-preview

蚂蚁集团推出 Ring-1T-preview,并将其定位为全球首个开源万亿参数推理大模型。该模型在多项测试中取得较好成绩,超过多个已知开源模型,并接近 GPT-5 水平。在自然语言推理和代码生成方面,Ring-1T-preview 展现出较强能力,团队仍在继续开展后训练,以进一步释放模型潜力。

【提要:】

🌟 Ring-1T-preview 发布,定位为全球首个开源万亿参数推理大模型。

🚀 在 AIME25 和 CodeForces 测试中表现优异,成绩接近 GPT-5。

🧠 团队正在推进后训练工作,继续提升自然语言推理能力。

10、DeepMind提出“帧链”概念,探索视频模型的视觉推理能力

DeepMind 提出“帧链”(CoF)概念,为视频生成模型提供新的技术思路。该方法支持视频模型在时间和空间两个维度进行推理,并展现出接近语言模型的通用能力。Veo3 在多个视觉任务中表现突出,体现出较强的感知、建模和操控能力。

image.png

【提要:】

🎥 “帧链”技术让视频模型具备跨时间和空间的推理能力。

🧠 Veo3 展现出较强的通用视觉能力,可处理多种未训练任务。

🚀 DeepMind 预测,未来通用视频模型可能取代专用模型,推动机器视觉发展。

详情链接:https://papers-pdfs.assets.alphaxiv.org/2509.20328v1.pdf

11、智谱发布开源大模型 GLM-4.6,编程能力对齐 Claude Sonnet4

智谱 AI 发布新一代开源大模型 GLM-4.6。该模型在 Agentic Coding 等关键能力上明显提升,编程能力已对齐国际顶尖模型 Claude Sonnet4,并超越 DeepSeek-V3.2-Exp,被称为国内最强代码生成模型。与此同时,GLM-4.6 在国产化适配方面取得进展,已成功部署于寒武纪国产芯片和摩尔线程 GPU,为构建自主可控的 AI 生态系统提供支持。


QQ20250930-155331.png

【提要:】

✨ GLM-4.6 的编程能力达到国际顶尖水平,并对齐 Claude Sonnet4。

🚀 在寒武纪国产芯片上实现 FP8+Int4 混合量化部署,推进国产硬件适配。

🔧 基于 vLLM 框架在摩尔线程 GPU 上以原生 FP8 精度稳定运行,提升 AI 生态自主性。

一句话总结

本期 AI 动态显示,大模型竞争正在从参数规模和基准成绩,进一步延伸至成本控制、工具调用、编程效率、实时交互以及端侧生态适配等具体应用能力。