欢迎阅读本期【AI日报】。本期关注AI产品与模型更新,覆盖视频生成、全模态大模型、开源小模型、语音交互、3D世界生成和多语言翻译等多个方向。

新鲜AI产品点击了解https://app..com/zh

今日重点

百度正式发布文心5.0,可灵2.5Turbo新增“首尾帧”功能,微博推出低成本开源模型 VibeThinker-1.5B。与此同时,OpenAI、World Labs、东北大学、谷歌和阿里巴巴也带来了多项AI产品与技术进展。

1、可灵2.5Turbo新增“首尾帧”能力,视频生成更可控

可灵2.5Turbo模型在发布后进一步补齐了AI视频生成的关键能力,在可控性、稳定性和画面一致性方面都有加强,更适合专业创作场景使用。模型在动态效果、文本响应、风格保持和整体美学表现上也有提升。

新增的“首尾帧”功能,让创作者能够更明确地设定视频起点和终点画面,从而提高生成结果与创作意图之间的一致性。

【提要:】

🚀 可灵2.5Turbo进一步提升了AI视频生成的可控性与稳定性。

🎨 动态效果、文本响应精度和风格保持能力都有增强。

📽️ 新增“首尾帧”功能,方便创作者控制视频开头和结尾画面。

2、百度发布原生全模态大模型文心5.0

百度在2025年11月13日举行的百度世界大会上,正式推出原生全模态大模型文心5.0。该模型参数规模达到2.4万亿,采用原生全模态统一建模技术,能够同时理解并生成文本、图像、音频和视频等多种信息。

据介绍,文心5.0在语言与多模态理解能力上已达到与国际顶尖模型相当的水平,图像和视频生成能力则处于全球领先位置。普通用户可通过文心App体验相关能力,开发者和企业用户则可通过百度千帆平台调用API服务。

image.png

【提要:】

🚀 文心5.0采用原生全模态统一建模技术,覆盖文本、图像、音频和视频等信息类型。

📈 多模态理解能力在权威基准测试中与全球顶尖模型相当。

🌐 用户可通过文心App体验,开发者可通过百度千帆平台调用API服务。

3、微博推出 VibeThinker-1.5B,主打低成本高推理能力

微博发布 VibeThinker-1.5B,这是一款15亿参数的大型语言模型,基于阿里巴巴 Qwen2.5-Math-1.5B 精调而成,并已在 Hugging Face、GitHub 和 ModelScope 上免费开放。

尽管模型规模不大,VibeThinker-1.5B 在数学和代码任务中的表现依然亮眼,甚至超过了拥有6710亿参数的 DeepSeek R1。它的后期训练成本仅为7800美元,明显低于同类模型。该模型采用“谱 - 信号原则”训练框架,目标是提升小模型的推理效率。

image.png

【提要:】

🧠 VibeThinker-1.5B 是微博推出的15亿参数开源AI模型,在数学和代码任务中表现突出。

💰 后期训练成本仅7800美元,低于同类模型常见投入。

🔍 借助“谱 - 信号原则”训练框架,小模型也能获得较强推理能力。

详情链接:https://huggingface.co/WeiboAI/VibeThinker-1.5B

4、OpenAI推出GPT-5.1,强调速度、准确性和个性化

OpenAI发布GPT-5.1,重点提升ChatGPT在灵活性、响应速度和个性化交互上的表现。新模型在语言表达、对话风格适配和情绪感知方面均有优化,使整体对话体验更加自然。

GPT-5.1还加入了自适应推理功能,能够根据任务复杂度调整处理时间,以适配不同问题和使用场景。

image.png

【提要:】

🚀 GPT-5.1提升了响应速度和语言清晰度,让对话更顺畅。

🧠 自适应推理功能可根据问题复杂度调整处理方式。

🎨 多种沟通风格选择进一步增强了个性化体验。

5、World Labs发布首款商用3D世界模型 Marble

李飞飞创办的 World Labs 推出首款商用3D世界模型 Marble。该模型支持通过多种输入方式生成可编辑的3D环境,并提供AI编辑能力,便于用户继续调整和定制场景。

Marble 兼容主流VR设备,可应用于游戏开发、影视特效等多个领域,为3D内容生成和沉浸式场景创作提供了新的工具选择。

image.png

【提要:】

🌟 Marble 是 World Labs 发布的首款商用3D世界模型,可生成可编辑环境。

🎮 产品内置AI编辑工具,支持用户设计和定制3D场景。

🕶️ Marble 兼容主流VR设备,可直接体验生成的3D世界。

详情链接:https://marble.worldlabs.ai/

6、东北大学开源 NiuTrans.LMT,覆盖60语种234个翻译方向

东北大学开源多语言翻译大模型 NiuTrans.LMT,在多语言翻译能力方面取得新进展。该模型支持60种语言、234个翻译方向,尤其对低资源语言翻译带来明显提升。

NiuTrans.LMT采用双中心架构,减少二次翻译造成的失真问题,从而提高跨语言、跨文化交流中的准确性和效率。

【提要:】

🧠 双中心架构支持中英双核心翻译,降低二次失真。

🌐 三层语言覆盖兼顾效率与公平,增强低资源语言翻译能力。

🚀 两阶段训练在 FLORES-200 上表现突出。

详情链接:https://github.com/NiuTrans/LMT

7、谷歌升级 Gemini Live 语音功能,支持语速和口音个性化

谷歌对 Gemini Live 语音功能进行了升级,通过多项核心能力优化AI语音对话体验。新功能让语音交互更自然,也为用户提供了更大的个性化空间。

此次升级包括语速可随口令实时调整、情绪感知与语气自适应,以及口音选择等能力,可用于更灵活的对话、语言训练和个性化交流场景。

image.png

【提要:】

🗣️ 语速可随口令实时变化,支持个性化语言训练。

😊 具备情绪感知和语气自适应能力,改善对话体验。

🎭 支持口音个性化,让语音互动更有差异化。

8、阿里启动“千问”项目,基于Qwen布局C端AI助手

阿里巴巴启动代号为“千问”的重点项目,计划打造同名个人AI助手,并全面对标ChatGPT。该项目基于Qwen模型推进,显示出阿里在C端AI应用方向的进一步投入。

这一动作意味着阿里将面向消费者的AI应用提升到战略核心位置,也标志着其正式加入全球AI应用层竞争。

【提要:】

🚀 阿里巴巴启动“千问”项目,目标是打造个人AI助手并对标ChatGPT。

💡 项目基于Qwen模型推进,依托模型能力和国际影响力。

📈 阿里将C端AI应用推向战略核心,进一步布局消费者市场。

一句话总结

本期AI日报显示,头部厂商和研究机构正在从全模态模型、视频生成、小模型推理、语音交互、3D生成和多语言翻译等多个方向加速推进AI应用落地。