欢迎阅读【AI日报】。本期聚焦人工智能领域的最新进展,覆盖模型能力升级、开发者工具、AIGC 平台和基础设施动态,帮助读者快速了解行业变化。

新鲜 AI 产品点击了解https://app..com/zh

今日重点

今天的内容集中在大模型开源、视觉生成、代码智能和算力基础设施几条主线。生数科技、火山引擎、阿里云、百度、微软、OpenAI、英伟达和 Meta 都有新动作,覆盖从内容生成到企业应用的多个方向。

1、生数科技推出 Vidu Q2,细微表情生成更自然

生数科技发布的 Vidu Q2 在图生视频能力上进一步升级,重点提升了细微表情的生成效果。通过更准确地还原人物情绪变化,这一模型让 AI 视频在自然度、情感传达和画面真实感方面都有所增强。

image.png

【提要:】

🎭 Vidu Q2 能更精细地捕捉表情变化,提升视频生成的自然表现与情感表达。

🎥 支持图生视频、首尾帧视频和可调时长等多种模式,适配不同创作需求。

💡 生数科技持续以 AI 技术服务创意产业,优化影像生成体验。

2、火山引擎上线炉米 Lumi,支持视觉模型 Lora 微调

火山引擎推出炉米 Lumi 平台,并首次支持豆包、即梦等同款视觉模型的 Lora 微调能力。该平台面向企业视觉内容生产场景,帮助企业更高效地打造专属视觉风格,以满足多样化需求。

image.png

【提要:】

🧠 炉米 Lumi 支持视觉模型 Lora 微调,便于企业定制差异化视觉风格。

🚀 平台覆盖图片生成到视频生成的完整流程,服务企业级 AIGC 场景。

💡 炉米 Lumi 可帮助企业构建定制化 AIGC 生产能力,优化用户体验。

3、通义千问开源 300+ 模型,下载量突破 6 亿

在 2025 云栖大会上,阿里云展示了通义千问项目的阶段性成果。阿里云 CTO 透露,通义千问已开源超过 300 个模型,累计下载量突破 6 亿次。这一成绩反映了其在开发者生态中的影响力,也体现出阿里云通过开源推动 AI 技术创新与落地的持续投入。

【提要:】

🚀 通义千问项目开源模型数量已超过 300 个,技术积累持续增强。

📊 模型总下载量突破 6 亿次,反映出开发者对相关 AI 技术的关注与使用。

🖼️ 通义万象已生成超过 3.9 亿张图片和 7000 多万视频,展现数字内容生成能力。

4、百度 Qianfan-VL 开源发布,昆仑芯助力多模态能力

百度正式开源最新视觉理解模型 Qianfan-VL,提供 3B、8B 和 70B 三个版本,以覆盖不同应用场景。该模型具备图像与文本联合理解能力,在 OCR、教育等领域表现突出,训练过程依托百度自研昆仑芯 P800 芯片完成。

【提要:】

🧠 Qianfan-VL 是一款多模态大模型,可同时理解和处理图像、文本信息。

💡 昆仑芯 P800 芯片为模型训练提供支撑,在功耗和效率方面优化大规模计算表现。

🚀 Qianfan-VL 系列已在 GitHub 和 Hugging Face 开源,开发者可自由使用。

详情链接:https://github.com/baidubce/Qianfan-VL

5、微软接入 Anthropic AI 模型,扩展 Copilot 能力

微软宣布在 Copilot 助手中接入 Anthropic 的 AI 模型,进一步扩展生成式人工智能产品能力。虽然微软与 OpenAI 仍保持紧密合作,但这次引入 Anthropic 技术也显示出其正在为商业客户提供更多模型选择。企业用户可使用 Anthropic 模型构建 AI 代理,这些模型将在亚马逊和谷歌云中运行。

image.png

【提要:】

🤖 微软在 Copilot 助手中加入 Anthropic AI 模型,推动产品能力多元化。

🔄 Microsoft 与 OpenAI 的合作仍然紧密,同时也开始采用 Anthropic 的相关技术。

🚀 企业用户可选择 Anthropic 模型构建 AI 代理,但需管理员启用后才能使用。

6、OpenAI 在美国新建五个数据中心,推动 Stargate 项目

OpenAI 宣布将在美国新增五个数据中心,以增强 Stargate 项目的算力支撑。Stargate 项目由多家公司共同发起,总投资规模高达 5000 亿美元,目标是为生成式人工智能发展提供更强大的基础设施能力。

【提要:】

🌐 OpenAI 将在美国建设五个新数据中心,Stargate 项目的总计算能力预计将接近 7GW。

💼 Oracle 将负责其中三个新数据中心建设,阿比林数据中心也将扩建并新增 600MW 计算能力。

🚀 OpenAI 计划未来每周增加 1GW 人工智能基础设施,以推动 AI 技术继续发展。

7、英伟达开源 Audio2Face,支持实时面部动画生成

英伟达开源生成式 AI 面部动画模型 Audio2Face,并提供 SDK 与训练框架。该模型支持离线处理和实时处理,可应用于游戏、影视等多个领域。目前,这项技术已被多家游戏开发商采用,用于提升虚拟角色的真实感与沉浸体验。

image.png

【提要:】

🔊 英伟达开源 Audio2Face 模型,推动虚拟角色面部动画生成能力提升。

🎮 支持离线渲染与实时流式处理,可适配多类内容制作场景。

🌟 该技术已被多家游戏开发商采用,有助于简化流程并增强角色真实感。

详情链接:https://build.nvidia.com/nvidia/audio2face-3d

8、Meta 发布代码世界模型 CWM,具备沙箱推演能力

Meta 推出 Code World Model(CWM),这是一款拥有 32B 参数的 AI 系统,能够在沙箱环境中对代码进行模拟和推演,从而减少潜在错误并提高调试效率。不过,该模型对硬件配置要求极高,需要双 H100 GPU 和 RDMA 技术支持。

image.png

【提要:】

🧠 CWM 会在生成代码前进行沙箱模拟,用于预测代码运行后的结果。

🔍 该模型能够更快定位代码问题,从而提升调试效率。

🚨 在执行命令前,CWM 可对潜在风险进行预警,增强代码执行安全性。

详情链接:https://github.com/facebookresearch/cwm