欢迎阅读本期【AI日报】。本期人工智能领域持续围绕多模态理解、实时翻译、AI 编程、电商交易与视频生成等方向更新,多家公司和团队带来了新模型、新功能及开源成果。
新鲜AI产品点击了解:https://app..com/zh
今日重点
豆包大模型1.6-vision、DeepSeek V3.2-exp、Claude Sonnet4.5 和 GLM-4.6 等模型相继发布或亮相,升级重点涉及视觉理解、长上下文处理、代码生成与推理效率。同时,ChatGPT 上线“即时结账”,OpenAI 计划推出基于 Sora2 的社交应用,DeepMind 则提出“帧链”概念,AI 应用和视频理解能力继续拓展。
1、豆包大模型1.6-vision发布,综合成本较上一代下降约50%
豆包大模型1.6-vision 已正式发布。新版本进一步强化多模态理解和推理能力,并加入工具调用能力,同时通过性能优化提升开发效率与使用性价比。与上一代相比,其综合成本约降低 50%。

【提要:】
🧠 支持工具调用,有助于提升视觉理解准确性。
💻 针对应用开发场景优化,进一步提高开发效率。
💰 综合成本较上一代降低约 50%,使用成本更具优势。
2、通义千问推出 Qwen3-LiveTranslate-Flash,同传延迟低至3秒
通义千问发布 Qwen3-LiveTranslate-Flash 实时翻译系统,面向多语言音视频场景提供同声传译能力。系统支持 18 种语言及多种方言,并采用视觉上下文增强技术,以提升复杂语境下的翻译准确性。同传延迟最低可达 3 秒,表现优于多款主流模型。

【提要:】
🌍 覆盖 18 种语言和多种方言,适应更广泛的沟通场景。
🧠 借助视觉上下文增强技术,改善复杂场景中的翻译效果。
⏱️ 同传延迟最低可达 3 秒,提升实时交流的连贯性。
3、DeepSeek发布 V3.2-exp,稀疏注意力机制让 API 成本降低一半
DeepSeek 发布实验模型 V3.2-exp,采用“稀疏注意力”机制,重点降低长上下文任务中的推理成本。该模型还结合“闪电索引器”和“细粒度标记选择系统”,以提高长上下文片段的处理效率。初步测试显示,V3.2-exp 能够将 API 调用成本降低 50%。

【提要:】
⚡ 通过稀疏注意力机制优化长上下文处理。
🔍 “闪电索引器”与“细粒度标记选择系统”协同提升运行效率。
💰 初步测试显示 API 调用成本可下降 50%,有助于降低 AI 应用使用门槛。
4、Anthropic发布 Claude Sonnet4.5,编码与复杂任务处理能力增强
Anthropic 发布 Claude Sonnet4.5。该模型在编码任务和复杂任务处理方面表现突出,被认为是当前表现较强的编码模型之一。新版本整体性能继续提升,支持多平台使用,并进一步加强安全性与对齐能力。

【提要:】
✅ Claude Sonnet4.5 在编码基准测试中表现优异,可实现 30 小时以上的自主工作时长。
🔧 检查点、上下文编辑和内存工具等功能,进一步提升开发效率与实用性。
🔒 强化安全性并减少风险行为,适用于高风险企业场景。
5、ChatGPT上线“即时结账”,聊天窗口内即可完成购物
ChatGPT 推出“即时结账”功能,用户无需跳转外部链接或浏览器页面,即可在聊天界面完成单件商品购买。该功能由 OpenAI 与 Stripe 合作开发的“代理商务协议”提供支持,并兼容多种支付方式。后续,这项能力还计划扩展到多件商品购物车和国际市场。
【提要:】
💡 用户可通过 ChatGPT 的“即时结账”功能直接下单。
🔒 “代理商务协议”用于简化交易流程、保障交易安全,并支持多种支付方式。
🌐 后续将拓展至多件商品购物车和国际市场。
6、OpenAI计划推出 AI 版 TikTok,短视频内容由 AI 生成
OpenAI 即将推出一款基于 Sora2 模型的社交应用,外界将其称为“AI 版 TikTok”。该应用的形态类似 TikTok,平台内的视频内容均由 AI 生成,单条视频时长限制为 10 秒。应用支持用户身份认证和肖像使用,并针对安全与版权问题进行设计,以改善使用体验并减少用户流失。
【提要:】
🎥 Sora2 生成的视频单条时长限制为 10 秒,面向短视频传播场景。
🔒 用户可以完成身份认证,Sora2 可使用其肖像生成视频,其他用户也可标记使用。
🛡️ OpenAI 将发送提醒,确保用户了解肖像使用情况,并处理版权相关问题。
7、Claude Code 2.0升级,新增检查点功能与 VS Code 插件
Anthropic 发布 Claude Code v2.0,并同步更新 Claude Sonnet4.5 相关能力。新版本进一步提升 AI 在编程场景中的自主性和集成能力,围绕检查点机制、终端与 IDE 优化以及 API 扩展,为开发者提供更高效的编程支持。

【提要:】
✅ Claude Code v2.0 加入检查点功能,可自动保存状态并支持回滚,提升开发过程的安全性。
🔧 VS Code 原生扩展进入 beta 测试,支持内联差异预览和图形化交互。
📈 Sonnet4.5 在 OSWorld 基准测试中得分达到 61.4%,尤其适合构建复杂代理系统。
8、百度地图升级小度想想 2.0,出行助手支持更强智能服务
百度地图在第七届世界新能源汽车大会上发布小度想想 2.0。作为行业首个深度融合的端到端语音语言大模型,该版本面向用户提供更智能、个性化的出行服务。其核心能力包括接入地图出行知识库和实时搜索数据,增强对复杂出行意图的理解;构建跨端记忆体,实现手机、车机等设备之间的衔接;同时支持即时、近期和长期记忆,用于提供个性化推荐。
【提要:】
🚗 接入地图出行知识库和实时搜索数据,提升复杂出行意图的理解与推理能力。
📱 跨端记忆体支持手机、车机等多种设备之间的连续使用。
🧠 具备即时、近期和长期记忆能力,可提供个性化推荐服务。
9、蚂蚁集团开源万亿参数推理模型 Ring-1T-preview
蚂蚁集团推出 Ring-1T-preview,并将其定位为全球首个开源万亿参数推理大模型。该模型在多项测试中取得较好成绩,超过多个已知开源模型,并接近 GPT-5 水平。在自然语言推理和代码生成方面,Ring-1T-preview 展现出较强能力,团队仍在继续开展后训练,以进一步释放模型潜力。
【提要:】
🌟 Ring-1T-preview 发布,定位为全球首个开源万亿参数推理大模型。
🚀 在 AIME25 和 CodeForces 测试中表现优异,成绩接近 GPT-5。
🧠 团队正在推进后训练工作,继续提升自然语言推理能力。
10、DeepMind提出“帧链”概念,探索视频模型的视觉推理能力
DeepMind 提出“帧链”(CoF)概念,为视频生成模型提供新的技术思路。该方法支持视频模型在时间和空间两个维度进行推理,并展现出接近语言模型的通用能力。Veo3 在多个视觉任务中表现突出,体现出较强的感知、建模和操控能力。

【提要:】
🎥 “帧链”技术让视频模型具备跨时间和空间的推理能力。
🧠 Veo3 展现出较强的通用视觉能力,可处理多种未训练任务。
🚀 DeepMind 预测,未来通用视频模型可能取代专用模型,推动机器视觉发展。
详情链接:https://papers-pdfs.assets.alphaxiv.org/2509.20328v1.pdf
11、智谱发布开源大模型 GLM-4.6,编程能力对齐 Claude Sonnet4
智谱 AI 发布新一代开源大模型 GLM-4.6。该模型在 Agentic Coding 等关键能力上明显提升,编程能力已对齐国际顶尖模型 Claude Sonnet4,并超越 DeepSeek-V3.2-Exp,被称为国内最强代码生成模型。与此同时,GLM-4.6 在国产化适配方面取得进展,已成功部署于寒武纪国产芯片和摩尔线程 GPU,为构建自主可控的 AI 生态系统提供支持。

【提要:】
✨ GLM-4.6 的编程能力达到国际顶尖水平,并对齐 Claude Sonnet4。
🚀 在寒武纪国产芯片上实现 FP8+Int4 混合量化部署,推进国产硬件适配。
🔧 基于 vLLM 框架在摩尔线程 GPU 上以原生 FP8 精度稳定运行,提升 AI 生态自主性。
一句话总结
本期 AI 动态显示,大模型竞争正在从参数规模和基准成绩,进一步延伸至成本控制、工具调用、编程效率、实时交互以及端侧生态适配等具体应用能力。

