本期AI日报汇总了多条人工智能行业进展:谷歌已向部分用户小范围推送 Gemini 3.0 Pro,百度发布文档解析模型 PaddleOCR-VL,爱诗科技完成 1 亿元人民币 B+ 轮融资,此外 Anthropic、Pinterest、微软 Azure、Kayak 等也公布了产品或功能更新。

新鲜AI产品点击了解https://app..com/zh

今日重点

从模型能力升级到应用落地,本期内容覆盖了多模态模型、OCR 文档解析、AI 视频生成、工作流效率工具、内容平台治理以及旅行搜索等多个方向。谷歌、百度、Anthropic 等公司的新动作,也反映出 AI 产品仍在向更强推理、更高效率和更明确的场景化应用继续演进。

1、谷歌 Gemini 3.0 Pro 开始小范围推送:推理和多模态能力同步增强,正式发布或在本月底

谷歌 DeepMind 团队已经开始向部分用户推送 Gemini 3.0 Pro。该模型在推理能力和多模态处理方面都有提升,计划在 10 月底正式发布。

image.png

【提要:】

🧠 Gemini 3.0 Pro 引入 Deep Think 推理架构,进一步加强多步骤复杂任务处理能力。

🌐 该模型支持文本、图像、音频、视频等多种输入形式,也可生成完整前端代码。

🚀 谷歌还在规划轻量级 Flash 变体,以适配移动设备和边缘计算场景。

2、百度发布文档解析模型 PaddleOCR-VL,OCR 技术再迎新进展

百度推出 PaddleOCR-VL,重点聚焦文档解析能力。该模型以轻量化设计、多语言支持和较高识别精度为特点,在 OCR 技术方向上展现出新的竞争力。

image.png

【提要:】

🌍 PaddleOCR-VL 支持 109 种语言,可覆盖多类文档处理任务。

⚙️ 模型核心参数规模为 0.9B,在效率和识别准确率之间取得平衡。

🚀 其推理速度提升明显,相比部分主流模型具有更优表现。

3、爱诗科技完成 1 亿元 B+ 轮融资,AI 视频业务持续推进

AI 视频生成公司爱诗科技完成 1 亿元人民币 B+ 轮融资。同时,公司年度经常性收入(ARR)已突破 4000 万美元,注册用户数超过 1 亿。随着产品迭代和技术更新,其在 AI 视频生成赛道中的竞争力继续增强。

image.png

【提要:】

🚀 爱诗科技完成 1 亿元 B+ 轮融资,反映出资本市场对其业务进展的认可。

📈 公司 ARR 已突破 4000 万美元,注册用户规模超过 1 亿。

💡 PixVerse V5 提升了生成效率和视频质量,并加入 Agent 创作助手功能。

4、Anthropic 推出 Claude “skills” 功能,提升 AI 在工作场景中的实用性

Anthropic 为 Claude AI 增加了 “skills” 功能,用于提升其在工作场景中的执行效率。该功能以文件夹形式整合指令、脚本和资源,帮助 Claude 更高效地完成特定任务,例如处理 Excel 文档或遵循品牌规范。用户也可以创建自定义技能,并在多个平台上使用。

image.png

【提要:】

🌟 Anthropic 推出 Claude “skills” 功能,进一步增强其在工作场景中的落地能力。

🛠️ 用户可以按需自定义技能,让 Claude 更贴合具体流程和任务要求。

🚀 这一更新与 OpenAI 推出 AgentKit 等功能形成呼应,显示行业仍在加速走向实用化。

5、Pinterest 推出 AI 内容限制工具,用户可自定义减少生成式 AI 图像

Pinterest 上线新的内容控制工具,允许用户自行降低信息流中生成式 AI 图像的显示比例。平台还引入 AI 修改标签,用于标识 AI 生成内容,以回应部分用户对 AI 内容增多的不满,并在 AI 创新与用户体验之间寻找平衡。

image.png

【提要:】

🖼️ 用户可通过设置减少生成式 AI 图像在信息流中的出现比例。

🤖 Pinterest 引入 AI 修改标签,用于标注 AI 生成内容。

🌐 平台希望在使用 AI 技术和维护用户体验之间找到折中方案。

6、全面开源的 LLaVA-OneVision-1.5 登场,多模态能力超过 Qwen2.5-VL

LLaVA-OneVision-1.5 是一款开源多模态模型,能够处理图像、视频等不同类型输入。该模型在多个基准测试中的表现较为突出,并超过了 Qwen2.5-VL。

image.png

【提要:】

🧠 LLaVA-OneVision-1.5 是一款新的多模态模型,支持图像和视频等多种输入形式。

📈 其训练流程分为三个阶段,目标是更高效地提升视觉与语言理解能力。

🏆 在基准测试中,该模型表现优异,超过 Qwen2.5-VL。

详情链接:https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5 https://huggingface.co/lmms-lab/LLaVA-OneVision-1.5-8B-Instruct

7、OpenAI 视频生成模型 Sora 2 上线微软 Azure:进入公共预览阶段

微软宣布,OpenAI 的视频生成模型 Sora 2 已在 Azure AI Foundry 国际版上线,并进入公共预览阶段。这也意味着生成式 AI 视频工具正在进一步走向商业化应用。

【提要:】

🎥 Sora 2 是一款多模态视频生成模型,支持文本、图像和视频输入,并可生成新视频内容。

💰 该模型按生成时长计费,价格为每秒 0.1 美元,适合企业用户批量调用。

🌐 Sora 2 目前仅在 Azure AI Foundry 国际版上线,中国区用户暂时无法直接访问。

8、Kayak 推出 “AI 模式”,旅行规划与预订更便捷

旅行搜索引擎 Kayak 推出了全新的 “AI 模式”,通过内置聊天机器人帮助用户完成旅行研究、规划和预订。该功能基于 ChatGPT 技术提供更具上下文的信息结果,并支持用户以开放式问题获取旅行建议。

image.png

【提要:】

🌍 Kayak 上线 “AI 模式”,用户可通过聊天机器人完成旅行规划和预订。

🗣️ 该功能支持旅行建议咨询和不同服务比较,并利用 ChatGPT 技术提供相关信息。

📅 “AI 模式”初期仅支持英语,后续将扩展到更多语言和平台,并加入语音请求功能。

一句话总结

本期AI动态显示,基础模型、多模态能力和垂直应用正在同步推进,AI 产品正从能力展示进一步走向工作、内容、视频和出行等具体场景。