欢迎来到本期【AI日报】。今天的内容涵盖数字人生成、AI推理、手机助手能力规范、实时语音模型、XR生态、编码模型、SQL诊断评测以及智慧停车等多个方向,集中反映了近期人工智能产品迭代与行业新动态。

新鲜AI产品点击了解https://app..com/zh

今日重点

可灵 Avatar 2.0、Gemini 3 Deep Think、VibeVoice-Realtime-0.5B、析言 XiYan-SQL 等产品和模型均有新进展。这些更新整体指向更自然的人机交互、更强的推理与编程能力,以及面向具体业务场景的 AI 工具落地。

1、KlingAI Avatar 2.0 上线引发关注:5 分钟唱跳一键生成,数字人体验进一步升级

KlingAI Avatar 2.0 通过多模态导演模块,将音频、图像和文本提示整合为更连贯的表演流程,让数字人在表情、动作和情绪表达上更自然、更有表现力。对于短视频制作、电商广告和教育内容等场景来说,这种能力提升有助于降低数字人内容的制作门槛。

【提要】

✨ Avatar 2.0 依托多模态导演模块,将音频、图像与文本提示串联为完整表演路径。

💡 表情控制与动作设计能力明显增强,改善了早期 AI 人物表演偏僵硬的问题。

🚀 支持 48fps 超高帧率与 1080p 高清输出,基础功能可在平台免费试用。

详情链接:https://app.klingai.com/cn/ai-human/image/new

2、谷歌发布 Gemini 3 Deep Think 模式,复杂推理能力再提升

谷歌推出 Gemini 3 Deep Think 模式,重点增强 AI 在复杂数学、科学和逻辑问题上的推理表现。该模式在多项基准测试中取得了较高成绩,包括在“人类最后的考试”中获得 41.0%,在 ARC-AGI-2 测试中结合代码执行达到 45.1%。其能力提升主要依靠并行推理技术,可以同时探索多个假设路径。Ultra 订阅用户可通过简单选择启用这一模式。

image.png

【提要】

🧠 Gemini 3 Deep Think 正式上线,面向复杂问题强化推理能力。

📊 在严格基准测试中表现突出,未使用工具时得分 41.0%,使用代码执行时达到 45.1%。

🚀 Ultra 订阅用户可直接选择体验,进一步扩展 Gemini 的能力边界。

详情链接:https://blog.google/products/gemini/gemini-3-deep-think/

3、豆包手机助手发布调整公告:AI 操作手机将进入规范化阶段

豆包手机助手发布调整公告,称将对 AI 操作手机的部分能力进行规范化处理。此次调整主要围绕平台生态维护和金融安全展开,对部分自动化操作以及金融类应用的代操作行为作出限制。

image.png

【提要】

📱 AI 操作手机功能需要用户主动授权,执行过程中用户也可随时终止。

🔒 将限制 AI 在 App 内进行刷分、刷激励等自动化操作。

💰 对银行、互联网支付等金融类应用中的代操作行为进一步收紧。

4、微软发布 VibeVoice 0.5B:0.5B 参数实现约 300 毫秒实时开口

微软推出实时文本转语音模型 VibeVoice-Realtime-0.5B。虽然参数规模只有 0.5B,但它能够实现接近实时的语音生成,并支持中英文实时转录与语音输出。在多角色对话场景中,该模型还能保持不同角色的语气、节奏和音色特征,同时具备情感表达和上下文记忆能力,让合成语音更接近自然交流。

image.png

【提要】

🧠 模型体积较小但表现突出,仅 0.5B 参数即可实现接近实时的语音生成。

🗣️ 支持中英文实时转录与语音生成,可自然处理多角色对话。

💡 具备情感表达和上下文记忆能力,增强语音交互的真实感。

详情链接:https://huggingface.co/microsoft/VibeVoice-Realtime-0.5B

5、Android XR 特别发布会前瞻:Gemini 驱动智能眼镜首秀,谷歌能否借“空间计算”扳回一城?

谷歌即将举办《The Android Show:XR Edition》特别发布会,外界关注重点集中在 Android XR 平台的软件更新和硬件生态进展。预计相关内容包括软件底座升级、硬件设备演示,以及开发者工具和可用性方面的更新。

image.png

【提要】

🧠 软件底座将迎来升级,系统响应速度、多设备协同能力和第三方开发者工具链将同步优化,以降低硬件厂商适配成本。

👓 硬件生态将集中亮相,三星 Galaxy XR 头显会参与演示,智能眼镜原型机或首次公开。

🚀 发布会直播后将开放技术文档与回放,Android XR SDK 将加入 Gemini Runtime。

6、最强编码模型上架!GPT-5.1-CodexMax 现已接入响应 API

OpenAI 宣布,其最新代理编码模型 GPT-5.1-CodexMax 已全面接入响应 API。开发者现在可以将这一编码模型直接整合到现有应用和生产工作流中,用于复杂任务分解、代码生成、多步骤推理和自主代理执行等场景。通过 API 开放后,开发者无需等待即可在更广泛的环境中调用该模型;使用 API 密钥调用 CodexCLI 的用户也已同步获得 GPT-5.1-CodexMax 访问权限。OpenAI 表示,此次更新旨在降低高性能 AI 编程能力的接入门槛,让更多产品和服务具备编程助手能力。

【提要】

🧠 GPT-5.1-CodexMax 是 OpenAI最新推出的编码模型,面向复杂任务分解和代码生成质量提升。

🚀 该模型已全面接入响应 API,开发者可将其集成到现有应用与工作流中。

💡 OpenAI 称,此次更新将进一步降低高性能 AI 编程能力的使用门槛。

7、阿里云析言 XiYan-SQL 强势夺冠,全球 SQL 诊断评测榜单第一

阿里云飞天实验室自主研发的数据分析智能体“析言 XiYan-SQL”在 BIRD-CRITIC 评测中取得优异成绩,登顶全部开放榜单,并超越多家国内外顶尖团队,刷新了 SQL 诊断与修复方向的行业纪录。该评测覆盖 MySQL、PostgreSQL、SQL Server、Oracle 等主流数据库系统,题目包含简单查询和复杂操作,整体难度高于传统测试。析言 XiYan-SQL 通过创新方法提升了模型的可执行性和可维护性,目前已在阿里云百炼平台上线,提供 SQL 生成与诊断服务。

image.png

【提要】

✅ 析言 XiYan-SQL 在 BIRD-CRITIC 评测中获得第一,超过多支顶尖团队。

📊 评测覆盖多类主流数据库,难度高于传统 SQL 生成测试。

💻 相关技术和模型已开源,支持开发者体验与参与贡献。

8、高德上线“AI 停车雷达”:分钟级预测车位空闲,北京已率先覆盖

高德地图推出“AI 停车雷达”功能,结合空间智能感知与 AI 视觉分析技术,对城市道路车位占用情况进行分钟级推演和动态可视化。该功能已在北京市上线,覆盖数万个道路停车位,也让导航服务从“到达目的地”进一步延伸到“寻找停车位”的完整流程。

亮点提要:

🚗 高德地图发布“AI 停车雷达”功能,用于提升停车效率。

🌆 北京率先上线,覆盖全市数万个道路停车位。

📊 该功能推动城市停车资源数字化,助力智慧交通体系建设。

详情入口:🔗 https://www.chinaz.com/ainews/23426.shtml

一句话总结

本期 AI 动态显示,生成式内容、复杂推理、AI 编程、数据分析和城市服务正在同步推进,AI 产品正从单点能力展示走向更具体的业务和生活场景落地。