欢迎来到本期【AI日报】。今天的内容主要聚焦大模型推理、AI视频生成、翻译模型、多模态交互、文档处理以及类脑模型等方向,多家公司和研究机构都带来了新产品、开源进展和功能更新。
新鲜AI产品点击了解:https://app..com/zh
今日重点
美团发布推理大模型 LongCat-Flash-Thinking,阿里 Wan-Animate 正式开源并面向 AI 视频生成场景,字节跳动旗下火山引擎推出豆包翻译模型。与此同时,华为与浙江大学、xAI、YouTube、IBM、中科院以及 OpenAI 也分别在 AI 安全、模型效率、创作者工具、文档转换、类脑计算和高算力服务等方面带来新的进展。
1、美团发布全新推理大模型 LongCat-Flash-Thinking
美团推出了 LongCat-Flash-Thinking。这款模型采用混合专家架构,在数学推理、通用推理和代码生成等任务中表现较强,为 AI 应用开发和研究提供了新的选择。

关键信息:
🧠 LongCat-Flash-Thinking 是一款基于混合专家架构的大型推理模型,总参数量达 5600 亿,可动态激活 186 亿至 313 亿个参数。
📊 该模型在数学推理、通用推理、代码生成等任务中表现突出,部分测试结果达到了顶级准确率水平。
🔧 模型权重已经开源,同时提供了详细的聊天模板和专属聊天网站,便于开发者体验、接入和研究。
详情链接:https://longcat.chat/
2、阿里 Wan-Animate 开源:支持一图生动画与人物无缝替换
Wan-Animate 的开源发布,为 AI 视频生成带来了新的工具。该模型围绕角色动画生成和角色替换两类任务展开,并结合多模态融合技术,为视频创作场景提供了更高效的生成能力。
关键信息:
🎭 Wan-Animate 可以同时处理角色动画生成和角色替换两项任务,用户提供一张图片和一段参考视频后,即可生成高精度动画视频。
💡 模型融合了骨骼信号控制体动、面部隐式特征提取,并通过 Relighting LoRA 模块优化环境照明,从而提升唇同步精度和全身动作复刻效果。
🚀 该模型在娱乐和商业创作场景中都有应用潜力,例如音乐视频、电商广告和企业培训内容制作,后续还有望扩展到多人物视频支持。
详情链接:https://github.com/Wan-Video/Wan2.2
3、字节跳动推出豆包翻译大模型:支持 28 种语言互译
字节跳动旗下火山引擎发布了通用翻译大模型豆包翻译模型。该模型支持 28 种语言互译,官方数据显示其性能达到或超过 GPT-4o、Gemini-2.5-Pro 等市场领先模型,同时在价格上也提供了较低的使用门槛。

关键信息:
🤖 豆包翻译模型支持 28 种语言互译,性能可与 GPT-4o 和 Gemini-2.5-Pro 相比。
💰 定价方面,输入每百万字符 1.20 元,输出每百万字符 3.60 元。
🔗 更完整的定价说明可查看火山引擎官方文档。
详情链接:https://www.volcengine.com/docs/82379/1820188
4、华为与浙江大学联合发布 DeepSeek-R1-Safe 大模型
华为与浙江大学合作推出 DeepSeek-R1-Safe。该模型是国内首个基于昇腾千卡算力平台的基础大模型,重点关注 AI 安全与模型性能之间的平衡。
关键信息:
🧠 DeepSeek-R1-Safe 基于昇腾千卡算力平台构建,聚焦 AI 安全与性能表现。
🛡️ 在多个有害信息防御维度中,该模型展现出较强防护能力,整体防御成功率接近 100%。
🚀 在通用能力基准测试中,DeepSeek-R1-Safe 将性能损耗控制在 1% 以内,实现了安全能力与通用能力的兼顾。
5、Qwen3-Omni 即将发布:端侧跨模态模型继续升级
Qwen3-Omni 是阿里巴巴云 Qwen 团队即将推出的最新跨模态模型。该模型已经向 Hugging Face 的 Transformers 库提交支持 PR,说明其开源集成正在推进。模型采用 Thinker-Talker 双轨设计,目标是提升资源受限设备上的部署效率,并适配实时交互场景。

关键信息:
🔥 Qwen3-Omni 来自阿里巴巴云 Qwen 团队,面向跨模态处理能力升级。
💡 Thinker-Talker 双轨设计有助于实现高效流式处理,更适合实时交互场景。
🚀 Qwen3-Omni 已向 Hugging Face Transformers 库提交支持 PR,标志着开源集成取得进展。
6、xAI 发布 Grok4Fast:降低计算量与单任务成本
xAI 推出 Grok4Fast 模型。该模型在计算量和运行成本上进行了优化,同时在相关基准测试中保持了较好的表现,为需要高效率、低成本的场景提供了新的选择。

关键信息:
🧠 Grok4Fast 的计算量减少 40%,有助于提升复杂任务处理效率。
💰 单任务运行成本降低 98%,便于企业控制模型使用开支。
📊 该模型在 GPQA Diamond 和 AIME2025 基准测试中表现优异,体现出较强性能。
7、YouTube 发布新工具与功能,面向创作者升级体验
YouTube 在年度活动中推出了多项新功能和工具,覆盖直播、变现以及 AI 辅助创作等方向。这些更新旨在帮助创作者更高效地管理内容,并提升与观众互动的体验。
关键信息:
🎥 工作室功能迎来更新,包括灵感标签、标题 A/B 测试和肖像识别等工具,覆盖内容管理流程。
🎮 直播能力进一步升级,支持小游戏、横竖屏直播和 AI 自动高亮等功能。
💰 新增品牌合作和购物计划等变现方式,为创作者提供更多收益渠道。
8、IBM 推出 Granite-Docling-258M,聚焦文件转换
IBM 发布了轻量级视觉语言 AI 模型 Granite-Docling-258M。该模型面向文档处理和文件转换设计,在识别准确度、多语言支持以及文档元素处理方面具有优势,能够保留原始文档版面结构,并支持多种输出格式。

关键信息:
📄 Granite-Docling-258M 是面向文件转换的轻量级模型,参数量为 2.58 亿。
🔍 与传统 OCR 软件相比,该模型在识别准确度上有明显提升。
🌍 模型目前支持中文、阿拉伯语和日语,后续还会扩展更多语言。
详情链接:https://huggingface.co/ibm-granite/granite-docling-258M
9、中科院推出类脑大模型 SpikingBrain:以 2% 数据实现百倍速度突破
中科院发布了类脑大模型 SpikingBrain。该模型在长文本处理场景中展现出较高速度和效率,其架构与算法设计也为人工智能模型的高效计算提供了新的探索方向。

关键信息:
🧠 SpikingBrain 采用混合线性注意力架构,将计算复杂度从二次方降低到线性。
💡 自适应阈值脉冲神经元机制可显著降低能耗,并实现较高的计算稀疏度。
🚀 在长文本处理任务中,该模型速度比主流模型快 100 倍,训练数据仅需 2%。
详情链接:https://github.com/BICLab/SpikingBrain-7B
10、OpenAI CEO 称将推出计算密集型新功能,部分仅限 Pro 用户
OpenAI 首席执行官 Sam Altman 表示,公司将在未来几周内上线一系列需要更多计算资源的新服务。相关功能初期只会向 Pro 订阅用户开放,并可能产生额外费用。Altman 也强调,OpenAI 的长期目标仍然是降低智能服务成本,让更多用户能够使用。
关键信息:
🚀 OpenAI 将推出计算密集型新服务,早期仅限 Pro 用户使用。
💰 由于计算成本较高,新功能可能涉及额外收费。
💡 Altman 表示,降低智能服务成本、提升可及性仍是 OpenAI 的长期目标。
一句话总结
本期 AI 动态显示,大模型正在同时向更强推理能力、更低运行成本、更高安全性和更多创作场景延伸,开源与端侧部署依然是重要方向。
