欢迎来到本期【AI日报】。今天的内容主要围绕人工智能领域的新品发布、模型升级与能力增强展开,覆盖大模型应用、视频生成、图像编辑、多模态模型以及 AI 编程评测等多个方向。

新鲜AI产品点击了解https://app..com/zh

今日重点

阿里千问APP已开启公测,基于Qwen3模型,直接对标ChatGPT;Google继续强化视频与图像创作中的多模态能力,Veo 3.1新增多图参考生成视频,Flow则集成Nano Banana模型;小米也更新了超级小爱“随心修图”,并同步开源7B多模态模型MiMo-VL。

1、阿里千问APP公测上线,面向ChatGPT发起竞争

阿里巴巴推出千问APP,底层基于Qwen3模型,定位就是与ChatGPT展开全面竞争。目前,千问APP的公测版已经在各大应用商店上架,后续还会推出国际版,进一步拓展海外市场。此外,Qwen3-Max的性能已经超过GPT5等国际模型,进入全球前三。

image.png

【提要:】

🧠 阿里巴巴发布千问APP公测版,底层采用Qwen3模型。

🚀 千问APP已上架各大应用商店,并计划推出国际版。

📈 Qwen3-Max性能超过GPT5等国际模型,跻身全球前三。

2、Gemini Veo 3.1加入多图参考能力,一次融合三元素生成视频

谷歌面向Gemini Pro/Ultra订阅用户推送了Veo 3.1视频模型更新,新增“Ingredients to Video”模式。用户可一次上传三张参考图,系统会分别提取人物、场景和风格特征,再融合生成8秒1080p视频。这一能力在提升视频生成质量和多样性的同时,也更强调角色一致性与光影衔接。

111.jpg

【提要:】

🌟 “Ingredients to Video”支持三张参考图共同生成视频。

🎨 输出视频内置SynthID隐形水印,用于加强版权保护。

🔊 支持同步生成原生环境音,增强视频沉浸感。

3、超级小爱上线“随心修图”,一句话即可自动出片

小米带来v7.8.50版本超级小爱更新,新增“随心修图”功能。用户只需通过自然语言下达指令,就能调用相册AI模型完成自动修图,无需复杂的手动操作。该功能还支持全局多模态交互,可以识别屏幕内容和摄像头画面,并执行较复杂的连续操作。

image.png

【提要:】

📱 超级小爱新增“随心修图”,一句话即可完成自动修图。

📷 功能支持全局多模态交互,可识别屏幕与摄像头画面,并执行复杂操作链。

🖼️ 该能力基于7B多模态大模型,可在本地推理,默认输出带水印,并保留原图备份。

4、小米开源7B多模态模型MiMo-VL,并推出AI管家Miloco

小米同时在Hugging Face和GitHub发布了7B参数多模态大模型“Xiaomi-MiMo-VL-Miloco-7B-GGUF”,并推出基于该模型的智能管家“Xiaomi Miloco”。Miloco能够通过米家摄像头识别用户活动和手势,并联动智能家居设备完成自动化操作,同时兼容Home Assistant协议。该模型采用非商用开源许可,用户可在配备NVIDIA GPU和Docker环境的Windows或Linux主机上进行一键部署。

【提要:】

🚀 小米发布7B参数多模态大模型“Xiaomi-MiMo-VL-Miloco-7B-GGUF”。

💡 智能管家“Xiaomi Miloco”可识别用户活动与手势,并联动智能家居设备。

🔒 模型采用非商用开源许可,支持在NVIDIA GPU与Docker环境下部署。

5、Google Flow集成Nano Banana模型,自然语言即可处理图像素材

谷歌为AI电影创作工具Flow新增图像编辑模块,并深度集成Gemini2.5Flash图像模型,代号Nano Banana。新功能支持通过自然语言完成一键去背景、主体分离和场景替换,处理后的素材可以直接拖入时间线生成8秒动态镜头。该能力面向Gemini免费版及以上用户开放,定价为0.039美元/张,企业级Vertex AI也已同步上线。

【提要:】

🔥 Flow集成Gemini2.5Flash图像模型,可用自然语言完成图像编辑。

💡 支持去背景、主体分离和场景替换,降低视频素材制作门槛。

🌐 提供API批量接口,面向短视频、电商海报等高频场景。

6、新一代多模态 AI DeepEyesV2:借助工具调用提升表现

DeepEyesV2是研究人员推出的一款多模态AI模型,具备图像分析、代码执行和网络搜索等能力。它通过更智能地调用外部工具来提升任务表现,在多个场景中取得了不错效果,部分情况下甚至超过了规模更大的模型。

image.png

【提要:】

🌟 DeepEyesV2通过智能使用外部工具,提升多模态任务表现。

🔧 模型采用两阶段训练流程,结合图像理解与工具调用能力。

📈 在多个基准测试中表现突出,显示出较小模型的潜力。

详情链接:https://arxiv.org/abs/2511.05271

7、NotebookLM升级支持图像导入,板书也能变成可检索知识库

谷歌为NotebookLM推出了新功能,允许用户上传黑板板书、教科书扫描页或街拍表格等图像内容。系统会通过OCR和语义解析处理图像信息,并支持用户用自然语言检索。该功能面向全平台免费开放,后续还会加入本地处理选项,以更好保护敏感数据。

image.png

【提要:】

📷 NotebookLM支持图像数据源,提升笔记整理与管理效率。

🧠 多模态模型可识别手写和印刷内容,并提取表格结构。

🔍 图像内容可通过自然语言检索,增强信息获取能力。

8、JetBrains推出AI编码智能体基准测试平台DPAI Arena

JetBrains发布DPAI Arena,这是一个开放式、多语言、多框架、多工作流的AI编码智能体基准测试平台。该平台用于评估AI工具在软件开发过程中的效率,支持多种编程语言和开发流程,能够以公平且可重复的方式比较不同AI工具的表现。

【提要:】

🌟 DPAI Arena是开放式AI编码智能体基准测试平台,用于评估AI工具的软件开发效率。

🛠️ 平台覆盖多种编程语言和工作流,可进行公平、可重复的性能比较。

🤝 JetBrains计划将该项目交给Linux Foundation,以推动更广泛的技术指导和后续发展。

详情链接:https://dpaia.dev/

一句话总结

本期AI日报显示,头部厂商正在加速把大模型能力落地到搜索、创作、修图、智能家居和软件开发评测等具体场景中,多模态与工具调用仍是近期产品升级的核心方向。