AI日报持续整理人工智能领域的最新动态,覆盖开发者生态、技术进展与创新应用,方便快速掌握每天值得关注的AI资讯。

热门AI产品点击了解https://app.aibase.com/zh

1、腾讯开源具备原生3D重建能力的超长程世界模型:HunyuanWorld-Voyager

腾讯发布 HunyuanWorld-Voyager,这是一套创新的视频扩散框架。它可以从单张输入图像出发,生成具备世界一致性的3D点云,并支持用户进行沉浸式探索。该模型在视频生成质量和场景重建效果上都有较突出表现,也显示出其在 AI 驱动的 VR、游戏以及仿真空间智能等方向的应用潜力。

【AiBase提要:】

🌍 HunyuanWorld-Voyager可根据单张输入图像生成具有世界一致性的3D点云,并支持沉浸式探索。

🎥 模型还能同步输出精确对齐的深度信息与RGB视频,适合高质量三维重建。

🏆 多项测试结果显示,HunyuanWorld-Voyager在视频生成质量和场景重建效果上均优于其他模型。

2、通义实验室推出新一代智能体开发框架 AgentScope 1.0

通义实验室发布 AgentScope 1.0,这是一个面向多智能体开发的开源框架,覆盖开发、部署、监控等全生命周期环节。框架采用核心框架、Runtime 和 Studio 三层技术架构,各部分都可以独立使用,并提供实时介入控制、智能上下文管理和高效工具调用三项能力,以支持智能体安全运行和高效执行。

image.png

【AiBase提要:】

🌟 AgentScope 1.0 是面向多智能体应用的新一代开发框架,提供覆盖全生命周期的解决方案。

🚀 框架具备实时介入控制、智能上下文管理和高效工具调用能力,有助于提升开发与运行效率。

🔒 AgentScope Runtime 提供安全的工具沙箱和高效的部署运行引擎,保障智能体运行的安全性与稳定性。

详情链接:https://github.com/agentscope-ai/agentscope

3、即梦AI系列模型开放 API,为开发者提供一站式图像与视频生成服务

即梦 AI 联合火山引擎全面开放 API 服务,面向企业提供图像与视频生成能力,帮助开发者和企业把创意更快转化为具体内容。

【AiBase提要:】

🎨 文生图3.0、文生图3.1等模型已开放 API 服务,可帮助企业更高效地生成图像与视频内容。

🎬 视频生成3.0pro 和动作模仿 DreamActor M1 等模型,能够满足多样化的内容创作需求。

💼 即梦AI借助火山引擎拓展企业级市场,推动生成式AI在商业场景中的应用创新。

4、腾讯开源翻译巨头 Hunyuan-MT-7B:斩获 WMT2025 三十项冠军,翻译界的新霸主!

腾讯推出的 Hunyuan-MT-7B 在 WMT2025 中取得了突出成绩,展现出较强的多语言处理能力。该模型以开源方式发布,有助于推动相关技术的应用与发展。

【AiBase提要:】

🧪 Hunyuan-MT-7B 在 WMT2025 中获得30个语种的第一名,体现出较强的翻译能力。

🌐 模型支持31种语言,其中包括多种小众语言,展现了腾讯在自然语言处理领域的技术积累。

🚀 通过开源方式发布,Hunyuan-MT-7B将推动相关技术发展,并助力全球交流与合作。

5、苹果推出 STARFlow:全新 AI 图像生成技术想力压 DALL-E 与 Midjourney

苹果公司推出了 STARFlow AI 图像生成系统。该系统将正则化流与自回归变换器结合,用于提升高分辨率图像生成的效率和质量;同时通过深浅设计与潜在空间操作进一步优化模型表现。苹果还与学术机构展开合作,推动AI技术发展。

image.png

【AiBase提要:】

🧠 STARFlow融合正则化流和自回归变换器,提升了图像生成效率。

💡 系统借助深浅设计和潜在空间操作,对模型表现进行优化。

🚀 苹果与学术机构合作推进AI技术发展,相关技术具有进一步应用的可能性。

详情链接:https://arxiv.org/pdf/2506.06276

6、苹果 FastVLM 上线:5分钟体验85倍速视觉 AI,数据永不出设备

苹果推出的 FastVLM 视觉语言模型已经开放公众体验,搭载 Apple Silicon 芯片的 Mac 可以直接使用。FastVLM 将视频字幕处理速度提升了85倍,模型体积也缩小了3倍以上;此外,它还支持在浏览器中加载轻量级版本,无需复杂安装。模型采用本地运行方式,数据不会离开设备,为隐私保护提供支持。

【AiBase提要:】

🍎 FastVLM具备近乎即时的高分辨率图像处理能力,并将视频字幕处理速度提升85倍。

💻 用户可以在浏览器中加载轻量级版本,无需复杂安装即可进行体验。

🔒 所有数据均在本地处理,既能保障隐私,也支持离线使用。

7、新模型 CoMPaSS-FLUX.1:提升 Flux 文本到图像生成的空间理解能力

CoMPaSS-FLUX.1 是基于 FLUX.1 文本到图像扩散模型开发的 LoRA 适配器,主要用于增强模型在生成图像时对物体空间关系的理解能力。该模型在多项基准测试中取得较好表现,尤其是在处理物体之间的空间关系方面有明显进展。

image.png

【AiBase提要:】

🌟 CoMPaSS-FLUX.1增强了文本到图像生成中的空间理解能力,在处理物体关系时表现突出。

📊 评测结果显示,该模型在多个基准测试中均有所提升,同时保持了较高质量的生成效果。

📚 模型训练采用经过严格筛选的数据集,以确保生成图像具备良好的空间关系与清晰度。

详情链接:https://huggingface.co/blurgy/CoMPaSS-FLUX.1

8、Cherry Studio 与硅基流动深度合作,免费提供 Qwen38B 模型

Cherry Studio 与硅基流动展开深度合作,向用户免费提供 Qwen38B 模型,进一步扩展多模型支持能力,并提升 AI 交互体验。

【AiBase提要:】

🧠 Cherry Studio与硅基流动合作,免费提供Qwen38B模型,进一步改善AI交互体验。

💻 平台支持多平台使用及多种主流大语言模型,简化了用户的使用流程。

🚀 通过提供跨行业智能助手,平台能够增强生产力与个性化功能。

9、谷歌推全新 Gemini API URL Context 功能,可详解网页内容

谷歌推出 Gemini API URL Context 功能,使 AI 能够解析并理解网页内容,帮助开发者简化相关流程,提高信息提取效率。

【AiBase提要:】

🌐 该API面向开发者,可解析和理解网页中的内容,支持PDF、图片等多种格式。

📊 功能能够处理最高34MB的网页内容,并提取“总资产”“总负债”等关键数据。

🔒 该功能无法突破付费墙,也不会处理YouTube视频和Google Docs等专用工具内容。

详情链接:https://towardsdatascience.com/googles-url-context-grounding-another-nail-in-rags-coffin/

10、Youtu-Agent 智能体框架正式开源,引领 AI 发展新潮流

腾讯优图实验室正式开源 Youtu-Agent 框架。该框架面向自主 AI 智能体的构建、运行与评估,兼顾高性能和灵活性,并支持开源模型。在多项基准测试中,Youtu-Agent 取得了较好成绩,成为 AI 社区可使用的一项工具。

image.png

【AiBase提要:】

✅ Youtu-Agent支持数据分析、文件处理等多种任务,有助于提高开发效率。

🚀 模块化设计允许开发者灵活调整智能体行为,便于构建定制化应用。

🌐 开源策略为全球开发者参与提供了条件,推动AI技术创新与协作。

详情链接:https://github.com/TencentCloudADP/Youtu-agent