本期 AI 日报覆盖多模态模型、浏览器原生 AI、AI 编程智能体、开源大模型以及 AI 内容生产等多个方向。DeepSeek 进入识图模式灰测,小红书新设 AI 一级部门,阿里推出程序员“数字分身”QoderWake,Chrome、Gemini、蚂蚁集团等也相继带来新动态。
新鲜AI产品点击了解:https://app..com/zh
今日重点
1、DeepSeek 开启识图模式灰度测试,多模态视觉理解能力落地
DeepSeek 在发布 DeepSeek-V4 后不久,就开始灰度测试多模态识图功能。这也意味着,它的多模态能力已经从概念阶段走向实际产品体验。当前,移动端和网页版都新增了“识图模式”入口,可用于基础视觉理解、图片内容描述,以及结合画面信息进行逻辑推理。
从目前表现来看,该功能在常规图像理解和画面还原方面效果不错,但在一些极端视觉场景中,识别准确率仍有提升空间。

【提要:】
✨ DeepSeek 正在灰度测试多模态识图功能,视觉交互能力继续落地。
🔍 模型在基础视觉理解、图像描述和逻辑推理方面表现较为突出。
⚠️ 面对更复杂或极端的视觉任务时,识别率还有优化空间。
2、文心一言5.1预览版上线 LMSYS 竞技场,目前位列全球第13位
文心一言5.1预览版已经低调出现在国际大模型盲测平台 LMSYS Chatbot Arena,并在总榜中排名全球第13位。这表明百度核心模型进入了新一轮快速迭代,也开始通过国际主流公开评测体系接受全球用户的直接对比和检验。
【提要:】
🚀 文心一言5.1预览版已上线 LMSYS Chatbot Arena。
📊 该版本目前在总榜排名第13位,具备一定竞争力。
🌐 百度借助公开评测平台检验模型表现,并推动国际化对标。
3、小红书成立 AI 一级部门 “Dots”
小红书宣布设立 AI 一级部门“Dots”,并同步成立企业智能部,以进一步加大对人工智能技术的投入。根据原文信息,Dots 主要覆盖 AI 模型研发、基础设施、工程落地和产品应用等环节;企业智能部则整合原有企业效率部和数据科学部,为 AI 时代的组织能力和人才配置提供支持。
此外,小红书还设立了海外部门“Rednote”和 Lab 1327 团队,用于推进国际化业务和新产品孵化。
【提要:】
✅ 小红书新设 AI 一级部门“Dots”,覆盖模型、基础设施、工程和应用等方向。
✅ 企业智能部整合原有企业效率部和数据科学部,强化组织与人才支撑。
✅ 海外部门“Rednote”和 Lab 1327 团队将服务于国际化业务及新产品孵化。
4、Chrome 正式发布 Prompt API:浏览器原生 AI 时代来临,网页可直接调用 Gemini Nano 本地模型
Chrome 发布 Prompt API,允许开发者通过 JavaScript 直接调用浏览器内置的 Gemini Nano 模型,让网页应用能够使用本地 AI 能力。该功能属于 Chrome 内置 AI 框架的一部分,也意味着网页在不依赖外部 API 的情况下,同样可以获得一定的模型能力。
由于模型在本地运行,相关数据无需上传云端,有助于提升隐私保护。同时,开发者接入 AI 能力的成本和复杂度也会进一步降低。

【提要:】
🌍 Prompt API 允许网页应用调用 Chrome 内置的 Gemini Nano 模型。
🔒 本地运行模式减少数据上传需求,有助于强化隐私保护。
🛠️ 开发者无需完全依赖外部 API,可降低开发门槛。
详情链接:https://developer.chrome.com/docs/ai/prompt-api
5、程序员“数字分身”上岗:阿里发布 QoderWake,实现代码修复全流程无人值守
阿里巴巴发布 QoderWake 和 Qoder 移动端,进一步完善其 AI 智能体生态,并把能力延伸到更多研发与运维场景。QoderWake 被定义为生产级数字员工,可自主完成代码变更简报整理、错误诊断等任务,并生成修复代码。
Qoder 移动端支持跨端协同,用户可以通过手机远程操控桌面端 Agent 执行复杂任务。阿里希望借助 Qoder 产品布局,推动 AI 从辅助工具逐步走向具备独立任务处理能力的生产要素。

【提要:】
💻 QoderWake 可处理代码变更简报、错误诊断等任务,并生成修复代码。
📱 Qoder 移动端支持跨端协同,用户可远程操控桌面端 Agent。
🔄 阿里通过 Qoder 推动 AI 从研发辅助工具向具备独立处理能力的生产要素演进。
详情链接:https://qoder.com/qoderwake
6、蚂蚁集团正式开源万亿级大模型 Ling-2.6-1T
蚂蚁集团正式开源万亿级大模型 Ling-2.6-1T。该模型采用创新的混合架构,并针对指令执行、工具适配和长上下文承接能力进行了优化,以提升智效比。
原文提到,Ling-2.6-1T 能适配多工具、多约束的复杂业务场景,并展现出较强的多步执行能力。在代码生成、缺陷修复以及噪声环境下的精准推理方面,该模型达到开源领域的顶尖水平。

【提要:】
🧠 Ling-2.6-1T 采用混合架构,以提升模型智效比。
🛠️ 模型支持多工具、多约束的复杂业务场景。
🚀 在代码生成、缺陷修复和精准推理方面达到开源领域顶尖水平。
详情链接:https://huggingface.co/inclusionAI/Ling-2.6-1T
7、巨日禄宣布与火山引擎达成深度合作 AI短剧进入“工业化”时代
杭州巨日禄科技有限公司宣布与火山引擎达成深度合作,并接入豆包视频生成模型 Seedance 2.0。原文指出,这一合作标志着 AI 剧制作开始进入“工业化”阶段。
借助火山引擎在算力和算法方面的能力,巨日禄实现了制作效率与画面可用性的双重提升,并搭建起覆盖前期创作到最终交付的全栈式技术架构,推动国内 AI 影视产业向更成熟的工业化方向发展。
【提要:】
🚀 效率与质量同步提升:AI 剧制作效率提升近10倍,生产周期由15-30天压缩至1-3天。
🖼️ 画面可用性明显提高:传统 AI 生成模式下画面合格率仅30%,新技术架构下已提升至90%以上。
🛠️ 双方构建全栈式技术体系,覆盖前期创作到最终交付,降低 AI 剧生产门槛并保障内容品质。
8、彻底告别复制粘贴!Gemini 迎来史诗级更新,一键生成 Office 文档
Gemini 新增了直接生成并导出多种格式文件的能力,进一步增强其作为生产力工具的实用价值。该功能提升了 Gemini 与办公软件之间的衔接效率,让用户在文档生成、格式导出和办公流转中减少重复操作。
根据原文信息,Gemini 支持 Google Docs、Word、Excel 等主流文档格式,并加入图像识别能力,可将手写笔记转换为排版规整的 PDF 文件。
【提要:】
✨ Gemini 支持直接生成并导出多种格式文件,有助于提升办公效率。
📊 支持 Google Docs、Word、Excel 等主流文档格式,兼容性较强。
🖼️ 新增图像识别能力,可将手写笔记转换为排版规整的 PDF 文件。
一句话总结
本期 AI 资讯显示,国内外厂商正从模型能力、产品入口、研发工具、内容生产和办公场景等多个方向推进 AI 落地,关注重点已从单点能力展示转向更具体的工作流和产业应用。

