本期 AI 日报涵盖了多模态模型、AI 硬件、视频生成、推荐算法、语音合成和影像功能等多个方向的最新进展。阿里巴巴发布紧凑型 Qwen3-VL,科大讯飞推出 AI 翻译耳机,谷歌、OpenAI、X 平台、巨人网络、vivo 与字节跳动也相继带来新动态。

新鲜 AI 产品点击了解:https://app..com/zh

今日重点

多模态和生成式 AI 正在朝着更轻量、更贴近实际使用场景的方向演进。阿里巴巴推出 4 亿和 8 亿参数的 Qwen3-VL 系列,重点面向边缘设备和资源受限环境;谷歌 NotebookLM 接入图像生成能力,让笔记内容可以进一步转化为视频;Gemini 代码中出现 Veo3.1 的相关痕迹,也意味着谷歌视频生成模型可能迎来升级。

在应用层面,科大讯飞 AI 翻译耳机强调实时翻译与声音复刻,OpenAI 计划从 12 月起对完成年龄验证的成年人放宽部分内容访问限制,X 平台则准备把信息流推荐更多交给 AI 系统来处理。

1、阿里巴巴发布紧凑型 Qwen3-VL 模型,多模态 AI 更适配边缘设备

阿里巴巴近日正式推出紧凑型 Qwen3-VL 视觉语言模型系列,包含 4 亿参数和 8 亿参数两个版本。此次更新意味着,多模态 AI 正进一步向边缘设备等资源受限场景靠拢。

QQ20251015-103538.png

关键信息:

💡Qwen3-VL 新模型提供 4 亿和 8 亿参数版本,主要面向边缘设备及低资源运行环境。

💡模型在 STEM 推理、视觉问答、OCR 等任务中表现突出,参数效率较高,性能接近更大规模模型。

💡通过优化 VRAM 使用率,紧凑型模型有望在消费级硬件上运行,从而降低多模态 AI 的使用门槛。

地址:https://huggingface.co/collections/Qwen/qwen3-vl-68d2a7c1b8a8afce4ebd2dbe

2、科大讯飞 AI 翻译耳机全球首发,主打实时跨语言沟通

科大讯飞全球首发 AI 翻译耳机。这款产品搭载升级后的同传技术,支持 60 种语言实时翻译,并加入“声音复刻”等功能,目标是让跨语言交流更自然、更顺畅。

关键信息:

🚀AI 同传技术升级:翻译体验更接近自然对话,减少机械感和碎片感。

🗣️支持声音复刻:用户可以用自己的音色播报翻译结果,并保持较高相似度。

🌐覆盖多语种场景:支持 60 种语言实时翻译,续航最长可达 42 小时。

3、谷歌 NotebookLM 接入图像 AI,笔记可一键生成视频

谷歌旗下 AI 研究助手 NotebookLM 已集成图像生成模型 Nano Banana。借助这一能力,用户可以将复杂笔记和文档快速转换为带动态插图和旁白的视频,适用于学习整理和内容创作。

关键信息:

🖼️ 笔记转视频:依托 Nano Banana,系统可根据文本自动生成动态插图。

🎨 多种视觉风格:支持水彩、动漫等六种视频视觉风格。

⚡ 面向 Pro 用户:该功能已开始向 Pro 用户推送,旨在提升内容生成效率。

4、ChatGPT 计划 12 月起向成年人开放部分受限内容

OpenAI 宣布,从今年 12 月开始,ChatGPT 将同步上线年龄验证系统。完成验证的成年用户将可以访问此前受限制的成人内容,同时平台还会推出自定义机器人交互风格功能,体现出从过度谨慎向差异化管理的产品调整。

关键信息:

🔓 内容限制调整:12 月起,成年用户的部分内容访问权限将放宽。

🆔 年龄验证前置:用户必须先完成年龄验证,才能使用相关功能。

🤖 支持自定义风格:用户可调整机器人的交互方式和个性表现。

5、Gemini 代码出现 Veo3.1 信息,谷歌视频生成能力或将升级

谷歌 Gemini AI 平台代码中被发现包含 Veo3.1 视频生成模型的免责声明,以及面向美国用户的推广弹窗。相关迹象显示,支持更长视频时长和更高真实感的新模型可能已经接近发布,谷歌也在加快视频生成领域的布局。

QQ20251015-134436.png

关键信息:

💻 代码中出现线索:Gemini 底层代码已包含 Veo3.1 免责声明。

⏱️ 视频时长提升:新模型预计可生成最长一分钟的高保真视频。

🌍 发布可能有地域限制:推广工作已接近启动,但首发范围可能仅限美国。

6、马斯克称 X 平台本周将发布 AI 算法更新,信息流推荐转向人工智能

埃隆·马斯克宣布,社交媒体平台 X 将在本周晚些时候发布算法更新,使信息流推荐进一步依赖人工智能。按计划,X 下月将全面切换至由 Grok 驱动的推荐系统,该系统每天会评估超过 1 亿条内容,以提供更精准、个性化的信息流体验。

QQ20251015-105822.png

关键信息:

🔄 推荐机制转向 AI:本周的算法更新将把信息流优化更多交给 Grok 等 AI 工具。

🧠 Grok 成为核心驱动:X 平台计划下月全面切换至 Grok 驱动的 AI 推荐系统,并发布新算法模型权重。

🎯 内容筛选规模扩大:Grok 每天将评估超过 1 亿条内容,以推荐用户更可能感兴趣的信息。

7、巨人网络联合清华大学开源 DiaMoE-TTS,多方言语音合成框架发布

巨人网络 AI Lab 与清华大学 SATLab 联合发布并开源 DiaMoE-TTS 多方言语音合成大模型框架。该框架旨在缓解现有方言 TTS 模型对海量专有数据的依赖,推动方言语音合成技术更加公平、普惠,并支持中文方言及多语种方言合成。

关键信息:

🤝 合作开源:巨人网络 AI Lab 与清华大学电子工程系 SATLab 联合首创 DiaMoE-TTS,并宣布全方位开源数据、代码和方法。

🛠️ 面向行业痛点:针对方言 TTS 过度依赖巨量专有数据的问题,DiaMoE-TTS 仅依赖开源方言 ASR(自动语音识别)数据,具备更高数据效率。

🌎 多语种可扩展:在推出中文方言版本前,该框架已在英语、法语、德语等多种语言上验证,具备面向全球的多语言扩展能力。

8、vivo X200 系列升级计划公布,影像和相册功能将更新

vivo 官方公布了 X200 系列手机的影像与相册功能升级计划,将陆续带来“希区柯克变焦 Live Photo”“舞台模式双视野录像”等新拍摄功能。

image.png

关键信息:

🛠️Live Photo AI 路人消除:用户可圈选并消除路人,同时保留动态照片完整性。

🛠️4K 视频转 Live Photo:支持对 4K 视频进行时长截取、优化和裁剪,并以 Live 原格式保存。

🛠️编辑体验增强:新增可逆化编辑和 LOG 视频色彩还原功能。

9、字节跳动开源 FaceCLIP,文本驱动高保真人脸生成模型上线

字节跳动在 Hugging Face 平台开源 FaceCLIP 模型。该模型属于文本驱动的高保真身份保持型人脸生成视觉-语言模型,用户可提供一张参考人脸和文本描述,生成保留原始身份特征、同时按文本调整表情、姿态和风格的新图像。

image.png

关键信息:

🛠️身份保持型生成:FaceCLIP 的核心能力是根据文本提示生成人脸图像,同时保持输入参考人脸的身份一致性。

🛠️核心技术创新:模型采用多模态编码策略,同步捕获身份信息和文本语义,实现深度融合,并放弃传统适配器模块。

🛠️版本与架构:提供基于 FaceCLIP-SDXL 和 FaceT5-FLUX 的两个主要版本,其中 FaceT5-FLUX 集成 FaceT5 编码器,增强文本到图像的转换精度。

一句话总结

本期 AI 动态显示,模型能力正朝着更轻量的设备、更具体的创作流程以及更贴近真实使用场景的产品体验持续延伸。