欢迎来到【AI日报】。这里持续整理人工智能领域的重要动态,聚焦开发者生态、技术走向和新产品应用,方便你快速了解当天值得关注的 AI 资讯。
新鲜 AI 产品点击了解:https://app..com/zh
今日重点
可灵AI推出数字人新能力,支持用一张角色图片生成最长 1 分钟的高清视频;腾讯混元团队联合高校提出 SRPO 技术,旨在提升 AI 生成人像和图像质感;抖音上线“AI求真”功能,用于识别和澄清误导性信息。与此同时,IBM、Meta、DeepSeek、OpenAI、通义 DeepResearch 等也在模型、硬件和产品层面带来新的进展。
1、可灵AI发布数字人新功能:一张图片生成 1 分钟高清视频
可灵AI上线数字人能力,进一步连通了静态图片与动态视频的生成流程。用户只需提供角色图片,再输入文字或音频内容,就可以较快生成高质量的数字人视频。该能力基于多模态理解和视频生成模型,支持多种角色创建,也覆盖中文、英语、日语、韩语等多语言场景,可用于内容创作、教育培训和企业宣传等方向。

【提要:】
📷 可灵AI上线数字人功能,让静态图片可以转为动态视频。
🎙️ 支持中文、英语、日语、韩语等多种语言处理。
💡 降低数字人视频制作门槛,普通用户也能生成更专业的内容。
详情链接:https://klingavatar.github.io/
2、腾讯混元新技术给大模型 “去油”,让AI生成图像更真实!
腾讯混元团队与香港中文大学(深圳)、清华大学合作推出 SRPO 技术,目标是提升 AI 生成图像的真实感,并改善 Flux 模型在人像皮肤质感等方面的不足。该方法引入“语义相对偏好优化”策略,同时结合 Direct-Align 策略对生成轨迹进行优化,以提升图像质量和训练效率。

【提要:】
🧪 SRPO 引入“语义相对偏好优化”策略,通过正向与负向词汇引导信号,中和奖励模型偏差。
📈 Direct-Align 策略通过注入可控噪声,并将其作为参考锚点进行图像重建,显著降低重建误差。
⚡ SRPO 技术训练效率极高,仅需 10 分钟便能超越现有方法,真实度和美学评分提升超过三倍。
详情链接:https://tencent.github.io/srpo-project-page/
3、IBM 发布 Granite-Docling-258M:开源企业级文档 AI 模型
IBM 发布开源视觉语言模型 Granite-Docling-258M,主要面向端到端文档转换任务。该模型能够在转换过程中保留文档布局信息,并提取表格、代码、公式等内容,最终输出结构化、机器可读的格式。相较传统 OCR 技术,它在文档理解和转换能力上更进一步。
【提要:】
🌟 Granite-Docling-258M 旨在提升文档转换精度,同时保留原有布局信息。
🔧 采用先进技术架构,相较前一版本 SmolDocling,在多个领域表现更突出。
🌍 新增多语言支持,扩展了模型的适用范围和使用灵活性。
详情链接:https://huggingface.co/collections/ibm-granite/granite-docling-682b8c766a565487bcb3ca00
4、Meta发布首款带屏幕AI眼镜Ray-Ban :随身佩戴的智能助理
Meta 推出首款带屏幕的 AI 眼镜 Ray-Ban,希望借助可穿戴设备提供更便捷的智能交互体验。该产品还可与神经腕带配合使用,实现更精准的操作控制,同时进一步减少用户对移动设备的依赖。

【提要:】
📱 右侧镜片内置显示屏,可展示应用程序、提醒和导航等信息。
🧠 支持搭配神经腕带,通过肌电图技术实现精准操控。
🌐 可连接云端,在眼镜上使用 Meta 旗下应用,并查看路线与实时翻译内容。
5、DeepSeek 论文登上 Nature 封面,AI 大模型首次通过同行评审
DeepSeek R1 相关研究论文登上《Nature》封面,也意味着大语言模型首次通过权威同行评审,为 AI 行业提供了新的学术参照。该模型通过强化学习在自主环境中实现自我演化,推理能力得到增强,并在数学竞赛任务中取得了亮眼成绩。
【提要:】
🧠 DeepSeek R1 通过强化学习在自主环境中持续演化,形成了更复杂的推理能力。
📊 在 AIME2024 数学竞赛中,DeepSeek-R1 的表现从 15.6% 提升至 71.0%,达到与 OpenAI 模型相当的水平。
🛠️ DeepSeek 团队采用结合拒绝采样和监督微调的多阶段训练框架,提升模型写作能力和整体表现。
6、OpenAI宣布ChatGPT 网页端新增 GPT-5 Thinking 调整功能
OpenAI 为 ChatGPT 网页端加入新的“Thinking 调整功能”,用户可按需选择 GPT-5 模型的思考时长,在回复速度和智能程度之间做出取舍。与此同时,OpenAI 也在推进儿童版 ChatGPT 的开发,以提升未成年人使用过程中的安全性。

【提要:】
🌟 ChatGPT 网页端新增可调节思考时长的功能,进一步改善用户体验。
🛠️ 提供标准、扩展、轻量、重度等多种模式,适配不同交流需求。
👶 OpenAI 正在研发儿童版 ChatGPT,以保障未成年人使用安全。
7、抖音上线 “AI求真” 功能,助你辨别谣言,寻找真相!
抖音上线“AI求真”功能,主要用于帮助用户识别谣言、澄清误导性信息,并提升平台的信息透明度和用户保护能力。
【提要:】
🧠 抖音“AI求真”功能上线,帮助用户识别并澄清误导性内容。
🔍 用户可通过点击链接跳转至“求真卡”页面,查看更完整的信息。
📢 平台结合谣言治理大模型和辟谣团队,进一步提升信息透明度。
8、通义DeepResearch发布!全开源AI模型让研究更简单
通义 DeepResearch 团队发布全开源 AI 模型,并在多个权威基准测试中取得了出色表现。其性能超过了许多国际知名模型,同时通过开放模型、框架和方案,推动 AI 研究生态的协作发展。

【提要:】
🧠 通义 DeepResearch 团队发布全开源 AI 模型,让 AI 从“能聊天”进一步走向“会做研究”。
🚀 在多个权威基准测试中取得先进成绩,模型性能超过许多国际知名模型。
🌐 模型、框架及方案完全开源,为全球科技社区提供开放合作案例。
一句话总结
今天的 AI 动态集中在数字人生成、图像真实感优化、文档模型、AI 眼镜、大模型研究评审、ChatGPT 功能更新、平台辟谣工具和开源研究模型等方向,显示 AI 正在内容生产、信息治理和科研辅助等多个场景持续落地。
