欢迎阅读【AI日报】。本期内容汇集人工智能领域的最新进展,涵盖多模态大模型、AI创作工具、办公插件、智能建站、音乐版权以及数字人生成等方向,便于开发者和行业关注者快速了解技术与产品动态。

新鲜AI产品点击了解https://app..com/zh

今日重点

字节跳动开源统一多模态大模型 Lance 3B,智谱上线 GLM-5.1 高速版 API,CapCut 也与 Google Gemini App 深度集成。与此同时,OpenAI、WordPress、Spotify、美团等产品和平台分别在办公、建站、音乐创作与数字人视频生成方面带来新的变化。

1、字节跳动开源 Lance 3B:一套模型覆盖图像、视频理解与生成

字节跳动开源了原生统一多模态大模型 Lance。该模型以 3B 参数规模覆盖多种能力,尝试缩小理解模型与生成模型之间的差距。借助共享上下文与能力解耦并行的设计,Lance 将图像、视频理解、内容生成以及跨模态编辑整合进同一框架中。

image.png

【提要:】

✨ Lance 采用共享上下文与能力解耦并行设计,面向多模态任务统一处理。

🚀 以 3B 参数量实现全功能覆盖,降低理解与生成模型之间的技术隔阂。

🔧 项目以 Apache 2.0 协议开源,可在相对平民级的算力条件下运行,有助于降低部署门槛。

2、智谱发布 GLM-5.1 高速版:API 输出速度达到 400 tokens/s

智谱推出 GLM-5.1 高速版 API,输出速度达到 400 tokens/s,刷新全球大模型 API 速度上限。该版本在保持旗舰级全尺寸能力的同时强调低延迟,并通过系统级工程优化进一步提升了模型调用效率。

【提要:】

🧠 智谱 GLM-5.1 高速版 API 实现 400 tokens/s 输出速度,刷新全球大模型 API 速度上限。

🚀 在旗舰级全尺寸能力与低延迟之间取得兼顾,突破行业常见取舍。

🔧 优化覆盖推理引擎、调度系统和基础设施层,通过系统协同提升整体性能。

3、CapCut 与 Gemini 深度集成:AI 创作工具进一步互联

CapCut 与 Google Gemini App 展开合作,用户可在 Gemini 应用内直接调用 CapCut 的创意和编辑功能。此次集成让 AI 创作流程更加顺畅,也推动内容创作工具继续向智能化方向演进。

image.png

【提要:】

🚀 CapCut 与 Google Gemini App 合作,在 Gemini 应用内接入 CapCut 的创意与编辑能力。

💡 双方合作旨在提供更无缝、高效的 AI 创作体验,减少跨应用切换带来的操作成本。

🌟 CapCut 表示,未来创作方式将更加对话化、直观化,并走向智能集成。

4、OpenAI 发布 ChatGPT for PowerPoint:用一句指令生成和优化 PPT

OpenAI 推出 ChatGPT for PowerPoint 插件,用户可以通过简单指令快速生成、修改并润色 PPT 内容。该插件还支持智能分析与修改,帮助提升演示文稿制作效率。

image.png

【提要:】

✨ ChatGPT for PowerPoint 插件面向全球用户开放体验,强调零门槛和免费使用。

💡 支持从零创建 PPT,也可一键修改、润色页面,并对方案进行“复盘”。

🔒 插件引入关键操作确认机制,让每一次修改保持可控。

5、WordPress 7.0 正式发布:原生 AI 能力进入建站流程

WordPress 7.0 正式发布,新版本原生集成 AI 能力,标志着网页搭建开始进入更智能的阶段。此次更新围绕内容创作、后台界面和移动端体验进行了升级,为用户提供更高效、更顺畅的建站与编辑流程。

image.png

【提要:】

🧠 原生集成 AI 能力,帮助提升内容创作效率。

🎨 后台界面进一步现代化,改善整体使用体验。

📱 移动端自定义能力增强,提升响应式编辑体验。

6、Spotify 联手环球音乐:推出 AI 翻唱与混音功能

Spotify 与环球音乐合作推出 AI 翻唱和混音功能,为音乐版权领域带来新的变化。该功能建立在合法授权基础上,为用户提供新的创作方式,同时通过分成机制保障艺术家权益。这也增强了 Spotify 在 AI 音乐方向的竞争力,并对其他 AI 音乐平台形成挑战。

【提要:】

🎧 Spotify 与环球音乐达成 AI 翻唱和混音协议,为粉丝提供合法创作工具。

⚖️ 合作强调“知情同意、致敬署名和合理报酬”三项原则,以区别于侵权模式。

📈 Spotify 股价因 AI 战略上涨 13%,显示其在音乐版权领域的影响力。

7、UniClaw2026 公测:AI 即时通讯走向多人协作模式

北京本源万象人工智能科技有限公司推出全新 AI 原生即时通讯产品 UniClaw。该产品打破传统单聊对话框模式,将 AI 从单人效率工具扩展为群体协作中的社交 Agent,开启面向多人协作的使用场景。文章还介绍了 UniClaw 的三大核心角色以及开放的 Agent 应用社区。

【提要:】

✨ UniClaw 作为 AI 原生即时通讯产品,打破传统单聊对话框模式,推动 AI 进入多人协作场景。

🧠 AI 智能体(Agent)可在群组中承担信息中枢、沟通润滑剂和主动协调人等角色,提升协作效率。

🚀 开放的 Agent 应用社区降低使用门槛,用户可一键引入特定功能 Agent,实现即插即用。

8、美团 LongCat-Video-Avatar1.5 开源:商用级数字人视频生成模型升级

美团龙猫大模型团队正式开源商用级数字人视频生成模型 LongCat-Video-Avatar1.5。新版本在唇形同步、物理合理性和长视频稳定性等方面都有提升,并通过多项技术升级增强了模型的商业应用价值和用户体验。

image.png

【提要:】

🧠 模型将音频特征提取编码器从 Wav2Vec2 升级为 Whisper-large,增强对音素变化和发音节奏的捕捉能力。

🔄 引入 GRPO 技术,优化手部与连续性对齐,改善手部畸变和动作不连贯问题。

🚀 采用 DMD 技术后,推理效率提升 15 倍,生成一段 10 秒视频约需 1 分钟。

详情链接:https://github.com/meituan-longcat/LongCat-Video

一句话总结

本期 AI 动态集中体现出一个趋势:大模型正从单点能力展示,进一步迈向多模态统一、工具深度集成和可落地的行业应用。