本期 AI 日报主要关注视频生成、多模态模型、AI 搜索和智能体平台等进展:可灵 AI 正式全量开放 O1 视频大模型,千问 APP 接入万相 Wan2.5,PixVerse V5.5、DeepSeek-V3.2、Runway Gen-4.5 等产品与模型也有新的更新。
新鲜 AI 产品点击了解:https://app..com/zh
今日重点
视频生成依然是本期内容的核心。可灵 AI、千问 APP、PixVerse 和 Runway 都在围绕视频创作能力做升级,重点覆盖音画同步、文生视频、图生视频、镜头延展、角色一致性和创意控制等方向。与此同时,DeepSeek-V3.2 通过稀疏注意力架构降低 API 成本并提升长文本处理效率,谷歌也在推进 AI 搜索体验与 Gemini 3 Pro 的国际扩展。
1、可灵 AI 全量上线 O1 视频大模型,支持一句话生成视频
可灵 AI 宣布,自主研发的 O1 视频大模型已正式全量开放。该模型采用 MVL 统一交互架构,可同时接收文字、图像和视频三类指令输入,并支持一次完成文生视频、图生视频、局部编辑以及镜头延展等任务。
在画面一致性方面,O1 模型通过多视角主体构建技术,尝试缓解镜头切换时可能出现的“特征漂移”问题,从而增强视频画面的连贯性。目前,该模型已在可灵 App 和官网同步开放体验,后续还将开放 API 接口,方便第三方平台接入。

关键信息:
🧠 O1 视频大模型采用 MVL 统一交互架构,支持文字、图像、视频三种指令输入。
🎬 可完成文生视频、图生视频、局部编辑和镜头延展等任务。
📊 可灵 AI 后续计划开放 API 接口,供第三方平台集成。
2、千问 APP 接入万相 Wan2.5,视频创作能力进一步增强
千问 APP 已接入万相 Wan2.5 模型,视频生成能力随之升级。用户可以结合自定义图片和文字生成动态视频内容,同时支持音视频同步输出,有助于降低视频创作门槛。
这次更新也让千问 APP 在动态视频生成、音画同步和个性化内容创作方面更完整,适合用户通过图片与文本快速生成更具表现力的视频作品。

关键信息:
🎥 千问 APP 接入万相 Wan2.5 模型,强化视频创作能力。
🎙️ 支持音视频同步输出,可生成音画同步的视频内容。
🔄 用户可上传照片并输入文字,生成动态唱跳视频。
3、PixVerse V5.5 发布,支持“导演级”音画同步
PixVerse 推出 V5.5 版本,进一步提升了视频制作体验。用户只需输入一句话,就能生成带声音且具备口型同步效果的高清视频。
新版本还加入多镜头自动切换能力,能够在视频生成过程中增强叙事连贯性与画面组织能力,让短视频创作流程更加简化。

关键信息:
🎥 支持一句话生成高清视频,并实现音画同步。
🔄 多镜头自动切换,有助于提升视频叙事逻辑。
🚀 自研架构用于提升视频生成速度与质量,提供一站式服务。
详情链接:https://pai.video
4、DeepSeek-V3.2 正式发布,引入稀疏注意力架构并降低 API 成本
中国人工智能初创公司深度求索(DeepSeek AI)发布了 DeepSeek-V3.2 系列模型,包含 DeepSeek-V3.2 和高计算增强版 DeepSeek-V3.2-Speciale。
新模型引入稀疏注意力机制(DSA),用于提高长文本任务效率,并将 API 成本降低 50%。其中,DeepSeek-V3.2-Speciale 在高难度推理任务中表现突出,原文称其甚至超越 GPT-5。该系列还提供开源内核和演示代码,支持研究人员与企业进行商业部署。
关键信息:
🧠 引入稀疏注意力机制(DSA),提升长文本任务处理效率。
🚀 DeepSeek-V3.2-Speciale 在高难度推理任务中表现优异,原文称其超越 GPT-5。
📊 API 成本降低 50%,并支持研究人员和企业商业部署。
详情链接:https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp
5、Runway 发布 Gen-4.5 视频生成模型,强化创作控制与视觉质量
Runway 推出新的视频生成模型 Gen-4.5,重点提升视觉准确性和创意控制能力,主要面向社交媒体短视频创作场景。
在竞争加剧的背景下,Gen-4.5 在物体和角色一致性方面表现较为突出。不过,原文也提到该模型仍存在因果推理和时间连贯性相关问题。与此同时,AI 生成内容的真实性继续引发行业讨论,相关建议包括为生成内容添加免责声明,以区分真实与虚假。

关键信息:
🎥 Runway Gen-4.5 提升视频生成的创意控制和视觉一致性。
📱 该模型主要针对社交媒体短视频,与部分面向长视频的竞争策略不同。
⚖️ AI 生成内容真实性问题引发讨论,原文建议添加免责声明进行区分。
6、谷歌优化 AI 搜索体验,Gemini 3 Pro 扩展至 120 个国家和地区
谷歌正在推动其 AI 模式和相关功能变得更易用、更普及。一方面,谷歌正在测试新的设计,以优化用户从 AI 概览切换到 AI 模式的体验,让搜索中的 AI 对话流程更加顺畅。
另一方面,Gemini 3 Pro 正在进行大规模国际扩张。原文提到,Gemini 3 Pro/Nano Banana Pro 已拓展至 120 个国家和地区,进一步扩大谷歌 AI 功能在全球市场的覆盖范围。

关键信息:
💡 谷歌正在优化 AI 概览到 AI 模式的过渡体验,提升对话流畅度。
🌍 Gemini 3 Pro/Nano Banana Pro 拓展至 120 个国家和地区。
🚀 谷歌继续强化搜索场景中的 AI 功能体验。
7、Lovart Touch Edit 上线,图像编辑进入“零蒙版”体验
Lovart 推出 Touch Edit 功能,通过自然语言指令结合智能识别技术,让用户可以更便捷地完成图像编辑。用户不必手动处理复杂步骤,也能对图片中的元素进行修改。
该功能的核心在于自动识别图像元素并依据指令完成编辑,同时 Select & Remix 支持多图混搭,用户可以拖拽并重组不同图片中的元素,从而提升设计工作流效率。

关键信息:
✨ Touch Edit 支持通过自然语言指令识别并编辑图像元素。
🧩 Select & Remix 支持多图混搭,可拖拽重组不同图片元素。
⚙️ 功能集成 GPT-4o、Flux Pro 和 Sora 等模型,服务于 AI 设计工作流。
8、蚂蚁数科 Agentar 入选中国智能体开发赛道“第一梯队”
蚂蚁数科 Agentar 平台凭借技术架构完整性、产品迭代成熟度,以及在金融领域的长期积累,入选中国智能体开发赛道“第一梯队”。
原文指出,Agentar 在 AI 智能体开发领域展现出领先实力,并依托金融场景中的技术经验和规模化落地成果,形成了较强的行业竞争力。其中,Agentar-Fin-R1 推理大模型在三项金融基准测试中位列第一。
关键信息:
🧠 蚂蚁数科 Agentar 平台在智能体开发领域具备领先表现。
💼 平台在金融领域积累了技术经验与规模化落地成果。
📈 Agentar-Fin-R1 推理大模型在三项金融基准测试中位列第一。
一句话总结
本期 AI 动态显示,视频生成模型正围绕音画同步、多模态输入和创作效率持续升级,同时大模型厂商也在通过架构优化、搜索体验改进和行业智能体平台推进 AI 应用落地。
