欢迎收看本期【AI日报】。今天的内容仍然围绕人工智能领域的产品迭代、模型发布和落地应用展开,涵盖视频生成、图像生成、AI硬件、输入法、语音模型以及协作工具等多个方向。
新鲜AI产品点击了解:https://app..com/zh
今日重点
腾讯元宝接入基于 HunyuanVideo1.5 的视频生成功能,用户可以通过一句话或一张图片直接生成短视频;谷歌推出 Nano Banana Pro,在 4K、联网搜索和 C2PA 验证等能力上进一步升级;夸克AI眼镜则继续与高德深化合作,持续拓展出行场景中的智能体验。
1、腾讯元宝上线新能力:一句话或一张图都能生成视频
腾讯元宝新增了视频生成入口,用户只需输入一句话,或者上传一张图片,就能生成对应的视频内容。该能力基于腾讯混元团队最新开源的 HunyuanVideo1.5 模型,采用 Diffusion Transformer(DiT)架构,参数规模为 8.3 亿,可生成 5 到 10 秒的高清视频。
这项更新进一步降低了视频创作门槛,让普通用户也能更轻松地完成内容生成,同时也为创作者提供了新的灵感来源,有助于丰富社交平台上的内容表达。

【提要:】
🎥 腾讯元宝新增视频生成功能,支持一句话或一张图直接生成视频。
🚀 HunyuanVideo1.5 可生成 5 至 10 秒高清视频,创作门槛更低。
💡 新能力为用户提供了更灵活的内容创作方式,也增强了内容表现力。
2、谷歌发布 Nano Banana Pro:基于 Gemini 3,支持 4K、联网搜索与 C2PA 验证
谷歌正式发布 Nano Banana Pro。该模型基于 Gemini 3,支持 4K 分辨率、14 个对象融合、5 人身份一致性保持,并加入联网搜索和 C2PA 验证功能。同时,其定价也有所上调。
从能力上看,Nano Banana Pro 重点强化了专业控制、联网生成以及双重水印机制,开发者也可以通过多种方式接入这一模型。

【提要:】
📷 专业控制:用户可在提示词中指定机位、景深、焦点、光效与色彩分级,默认提供 6 张高保真成片供选择。
🌐 联网生成:模型可实时检索网络信息,自动抓取食谱、资讯或股价并生成对应信息图,目前已接入 NotebookLM、Flow、Slides 与 Vids。
🔒 双重水印:SynthID 隐形水印与 C2PA 内容凭证同步写入,用户上传图片后,可在 Gemini App 中验证图片是否由谷歌模型生成或修改。
3、夸克AI眼镜继续牵手高德,接入更多出行服务
夸克AI眼镜进一步深化与高德的合作,围绕出行场景推出了多项新功能,包括导航投屏、方向指引随头部转动调整等能力,目的在于改善步行、骑行和城市探索过程中的使用体验。
在合作继续加码后,夸克AI眼镜还将陆续接入扫街榜、打车等服务,让这款眼镜在日常出行和周边探索中的实用性进一步提升。

【提要:】
🚀 夸克AI眼镜新增导航投屏能力,可实现手机与眼镜之间的联动。
🧭 导航方向会随头部转动变化,提升步行和骑行场景下的便捷性与安全性。
🍽️ 支持周边搜索及打车行程提醒,进一步优化城市出行体验。
4、豆包输入法低调现身小米商店,主打智能语音交互
豆包输入法已在小米商店低调上线。作为豆包生态的新成员,这款输入法搭载了与豆包 App 同源的语音输入技术,支持多种语言和输入方式,并加入智能联想能力,目标是提升用户日常输入效率。
【提要:】
🎙️ 支持多种方言、纯英文以及中英混合输入,并优化了“轻声说话”功能。
⌨️ 提供经典 9 键和 26 键布局,同时内置剪贴板、常用语、即时翻译等工具。
🧠 智能联想覆盖文字、标点符号、Emoji、数学公式和日期等内容,帮助提升输入效率。
5、月之暗面计划明年下半年上市,估值或达 40 亿美元
月之暗面计划在明年下半年进行首次公开募股(IPO)。在融资完成后,公司估值可能达到约 40 亿美元。该项目聚焦月球资源探索及其在地球上的应用,因此持续受到科技爱好者和投资者关注。
【提要:】
🌕 月之暗面计划于明年下半年进行首次公开募股(IPO)。
💰 融资完成后,公司估值可能达到约 40 亿美元。
🚀 月之暗面致力于探索月球资源及其在地球上的应用。
6、MOSS-Speech 开源:国内首个语音到语音大模型,去掉文本中介
MOSS-Speech 是复旦大学 MOSS 团队推出的国内首个端到端语音到语音对话模型。它不再依赖 ASR→LLM→TTS 的传统流水线,而是可以直接完成语音问答,并支持情绪模仿和笑声生成。
据介绍,MOSS-Speech 在多项评测中表现突出,目前代码和权重已经开源,同时支持商用许可。

【提要:】
🚀 MOSS-Speech 实现端到端语音到语音对话,无需文本中介。
📊 在 ZeroSpeech2025 任务中,WER 降至 4.1%,情感识别准确率达到 91.2%。
📦 提供 48kHz 超采样版与 16kHz 轻量版,支持实时推理和本地私有声音克隆。
7、ChatGPT 群聊功能正式上线:最多支持 20 人,AI 可参与头脑风暴
ChatGPT 群聊功能已经正式开放,最多支持 20 人同时参与。用户可以通过分享链接邀请其他人加入群聊,AI 也能进入对话参与讨论,从而提升团队协作和头脑风暴效率。
OpenAI 同时强调了隐私保护,群聊创建者的个人数据不会被共享。

【提要:】
🤖 ChatGPT 群聊功能正式开放,最多支持 20 人同时参与。
🌟 用户可通过分享链接邀请他人加入群聊,适用于协作讨论场景。
🔒 群聊创建者的个人数据受到保护,AI 可根据对话需要灵活参与。
8、谷歌 NotebookLM 更新:AI 一键生成专业 PPT,配图由 Nano Banana Pro 驱动
谷歌 NotebookLM 升级后新增了 Slide Decks 功能,可以将用户上传的资料转换为专业级演示文稿。该功能的配图由 Nano Banana Pro 模型驱动,用于提升生成内容的视觉效果。
此外,NotebookLM 还支持自定义提示词,方便用户对生成结果进行更细致的调整。

【提要:】
🖼️ 新增 Slide Decks 功能,可将资料一键生成专业 PPT。
🎨 配图由 Nano Banana Pro 模型驱动,用于提升视觉呈现效果。
⚙️ 支持自定义提示词,方便用户进行更深度的定制化生成。
一句话总结
本期 AI 动态显示,视频生成、图像生成、智能硬件、语音交互和协作工具都在继续向更低门槛、更强实用性和更丰富场景扩展。
