今日重点

本期 AI 日报聚焦多款新模型与产品动态:腾讯混元开源 10 亿参数 OCR 模型 HunyuanOCR,豆包输入法正式上线并深度整合 AI,Anthropic 发布旗舰模型 Claude Opus4.5,OpenAI 则为 ChatGPT 推出“购物研究”功能。此外,AMD、IBM 与 Zyphra 合作发布 ZAYA1,微软、谷歌和亚马逊也分别带来 Fara-7B、NotebookLM 新功能和 Amazon Leo 企业测试进展。

新鲜AI产品点击了解https://app..com/zh

1、腾讯混元开源 HunyuanOCR 模型:10 亿参数刷新多项 OCR 表现

腾讯混元正式开源全新 OCR 模型 HunyuanOCR。该模型规模为 10 亿参数,基于混元原生多模态架构构建,在多项业内 OCR 应用榜单中取得 SOTA 成绩。HunyuanOCR 采用端到端范式设计,兼具部署便利性与较强性能,可用于多语种文档解析、票据字段提取、视频字幕抽取等场景。

image.png

【提要:】

🔥 HunyuanOCR 是轻量级 OCR 模型,参数规模仅 10 亿,更便于部署和使用。

📊 在 OmniDocBench 测评中,HunyuanOCR 获得 94.1 分,超过谷歌 Gemini3-Pro 等领先模型。

🌍 支持 14 种高频小语种与中/英文互译,并在 ICDAR2025 端到端文档翻译比赛中获得小模型赛道冠军。

详情链接:https://hunyuan.tencent.com/vision/zh?tabIndex=0 https://github.com/Tencent-Hunyuan/HunyuanOCR

2、豆包输入法正式上线:AI 深度整合,支持复杂语境预测与离线使用

豆包输入法已正式上线。该产品将 AI 能力融入输入流程,可在复杂语境下进行智能预测,并支持离线使用,面向用户提供更高效、便捷的输入体验。

image.png

【提要:】

🗣️ 支持多种方言、英语以及中英混合输入,并可适应嘈杂环境。

⌨️ 借助 AI 技术提升长句输入准确率,并结合上下文进行自动纠错。

🌐 界面保持整洁无广告,同时支持离线语音输入。

3、Anthropic 发布 Claude Opus4.5:面向更高智能与效率的混合推理模型

Anthropic 推出最新旗舰模型 Claude Opus4.5。该模型在编码、推理和长期任务管理方面表现突出,面向软件工程、多智能体协作、办公自动化等场景提升生产力。同时,Opus4.5 在安全性、效率以及资源使用灵活性方面也进行了重要改进。

【提要:】

🧠 核心能力覆盖编码、推理与长期任务管理,性能达到世界领先水平。

🚀 支持较长上下文窗口,并引入 “effort 参数”,用于提升计算强度与输出质量。

🔒 安全性进一步增强,对齐性和鲁棒性优于此前版本,更不易被误导。

4、ChatGPT“购物研究”上线:结合用户“记忆”进行深度推荐

OpenAI 推出名为“购物研究”的新功能,使 ChatGPT 能够依据用户对话历史进行个性化产品搜索和推荐。该功能在假日购物季期间基本不受限制,并由专用模型提供支持,准确率达到 64%。

image.png

【提要:】

🛒 “购物研究”会分析用户历史对话,从而给出更个性化的推荐。

🔍 该工具能够主动提问,并生成可视化购物指南。

📊 专用模型准确率达到 64%,明显高于标准模型。

5、全球首个“纯 AMD”训练 MoE 大模型 ZAYA1 发布:14T tokens 与 CCA 注意力加持

AMD 与 IBM 及 AI 初创公司 Zyphra 合作推出 ZAYA1。这是全球首个全程基于 AMD 硬件训练的 MoE 基础模型,在预训练数据规模、性能表现和架构创新方面展现出竞争力,尤其在数学和 STEM 推理领域表现突出,整体性能对标 Qwen3。

【提要:】

🔥 ZAYA1 是全球首个全程基于 AMD 硬件训练的 MoE 基础模型,展示了 AMD 在大规模模型训练中的潜力。

💡 CCA 注意力机制可显著降低显存占用,并提升长上下文吞吐能力,体现其架构创新。

📈 ZAYA1 在多个基准测试中与 Qwen3 系列表现相当,并在部分任务中超过 Qwen3 专业版。

6、微软推出 Fara-7B:可在本地运行的计算机智能助手

微软发布 Fara-7B,这是一款拥有 70 亿参数、可本地运行的计算机智能助手,重点关注数据安全与隐私保护。它通过视觉方式理解和处理网页,使交互更加直观,并在任务执行效率上超过其他大型模型。

image.png

【提要:】

🌟 Fara-7B 是本地运行的计算机智能助手,强调数据安全和隐私保护。

⚙️ 该模型以视觉方式处理网页,交互更直观,效率远超其他大型模型。

🛡️ Fara-7B 具备“关键点”识别能力,可在关键操作前让用户进行确认,从而提升安全性。

7、谷歌 Nano Bana Pro 模型首秀:NotebookLM 新增幻灯片和信息图能力

谷歌为 AI 笔记工具 NotebookLM 增加幻灯片生成器功能,用户可以更快地将笔记或资料整理为简洁的演示幻灯片。该功能基于谷歌 Nano Bana Pro 模型,也就是 Gemini3Pro 图像生成能力,目标是提升资料整理效率和视觉呈现效果。

【提要:】

✨ NotebookLM 新增幻灯片生成器,可帮助用户高效整理笔记并生成演示草稿。

🖼️ 功能基于 Nano Bana Pro 模型,支持把详细提示转化为精确且包含大量文字的图像。

📄 当前支持导出为 PDF 格式,未来计划支持 Google Slides 和 PowerPoint 格式。

8、Amazon Leo 开放企业测试:卫星直连 AWS,计划 2025 年底启动、2026 年全面商用

Amazon Leo 的推出代表亚马逊在低轨卫星网络上的重要进展。该服务提供三类终端设备,支持高速数据传输,并通过 AWS 骨干网实现安全连接,强调“卫星+云+AI”一体化模式,主要面向工业级场景和偏远地区通信需求。

【提要:】

🛰️ Amazon Leo 提供三种终端设备,分别适用于工业级场景、偏远办公和轻量级应用。

🔒 终端采用军规级设计与 AES-256 加密,以保障极端环境下的稳定运行和数据安全。

🌐 每颗卫星都可作为 AWS 边缘节点,客户能够直接调用云服务,形成差异化竞争力。

一句话总结

从开源 OCR、AI 输入法到旗舰模型、购物推荐和卫星云服务,本期动态显示 AI 正继续向办公、开发、输入、检索、通信等更具体的应用场景深入落地。