欢迎查看本期【AI日报】。近期 AI 行业动态密集,内容覆盖大模型能力升级、AI 应用平台生态、3D 与音频生成技术、资本市场进展,以及智能硬件新品等多个方向。

新鲜AI产品点击了解https://app..com/zh

今日重点

谷歌推出 Gemini 3 Flash,强调免费、高速和接近“零延迟”的使用体验,并在部分高难度评测中超过 Gemini 3 Pro。火山引擎在 FORCE 大会上发布豆包大模型 1.8 与 Seedance 1.5 Pro,同时带来“AI节省计划”。此外,MiniMax 已通过港交所上市聆讯,国产大模型企业的资本化进程继续向前推进。

1、Gemini 3 Flash登场:免费、极速、智力反超Pro,谷歌AI全面进入“零延迟”时代

谷歌发布了新一代轻量级模型 Gemini 3 Flash。原文显示,该模型的响应速度达到前代的三倍,交互体验接近“零延迟”。在多项高难度基准测试中,Gemini 3 Flash 还超过了同期旗舰模型 Gemini 3 Pro,这也是 Flash 系列首次在同期对比中实现对 Pro 版本的反超。

image.png

【提要:】

🧪 在代码修复权威榜单 SWE-bench 上,Gemini 3 Flash 得分为 78%,略高于 Gemini 3 Pro 的 76.2%。

🧠 在博士级推理测试 GPQA Diamond 中,Gemini 3 Flash 取得 90.4% 的成绩。

⚡ 在高难度综合评估 Humanity’s Last Exam 中,Gemini 3 Flash 得分 33.7%,明显超过前代旗舰 Gemini 2.5 Pro。

2、火山引擎FORCE大会亮剑:豆包大模型1.8+Seedance 1.5 Pro发布,日均50万亿Tokens登顶中国第一

火山引擎在 FORCE 大会上正式发布豆包大模型 1.8 和视频生成模型 Seedance 1.5 Pro,并同步推出“AI节省计划”,目标是进一步降低企业应用大模型的成本门槛。豆包大模型 1.8 在推理、多语言、代码生成、工具调用等核心能力上均有增强;Seedance 1.5 Pro 则重点提升视频生成质量和一致性。原文提到,豆包大模型日均 Tokens 使用量已突破 50 万亿,位居中国第一、全球第三,显示其应用规模正从技术产品阶段走向产业级落地。

image.png

【提要:】

🧠 豆包大模型 1.8 在推理、多语言、代码生成和工具调用等关键能力方面完成升级。

🎥 Seedance 1.5 Pro 支持更长时长、更高帧率的可控视频生成,面向短视频、广告、游戏等内容生产场景。

💰 “AI节省计划”通过模型压缩、推理优化和资源调度等方式,帮助企业降低大模型使用成本。

3、苹果开源 SHARP 模型:告别漫长等待,1秒让平面照片跃升3D 空间

苹果公司近日开源了 AI 模型 SHARP。该模型能够将普通 2D 照片转换为具备真实物理比例的 3D 场景,处理耗时不到一秒。SHARP 采用“3D 高斯泼溅”技术,通过训练学习通用空间几何规律,仅需一次快速扫描,就能预测数百万个包含光影信息的“高斯球”位置。原文称,SHARP 的成像质量领先于业内最强模型,并支持真实相机移动模拟。目前,苹果已在 GitHub 上发布 SHARP 的完整代码和资源,开发者可下载使用。

【提要:】

⚡ 速度实现量级突破:SHARP 将 2D 转 3D 的处理速度提升三个数量级,可在不到一秒内完成近实时转换。

🌐 领先的 3D 生成技术:基于 3D 高斯泼溅技术,模型通过单次神经网络前馈预测数百万个 3D 点位,以还原真实物理比例。

🔓 全面开源生态:苹果已在 GitHub 开源 SHARP 的代码与资源,面向空间计算和 3D 内容开发者开放。

4、Meta发布SAM Audio:全球首个支持“点击分离声音”的多模态音频模型,一键提取吉他声、人声或狗叫

Meta 发布 SAM Audio。按照原文介绍,这是全球首个支持多模态音频分离的模型,可根据文本、视觉和时间片段提示提取目标声音,例如吉他声、人声或狗叫。该技术首次将人类自然感知声音的方式复刻到 AI 系统中,具备重要意义。

111.jpg

【提要:】

🎧 文本提示:用户可通过语义描述提取对应声源。

👁️ 视觉提示:点击视频中的发声物体,即可分离相关音频。

⏱️ 时间片段提示:标记时间区间后,系统可自动处理同类声音。

详情链接:https://ai.meta.com/samaudio/ https://github.com/facebookresearch/sam-audio

5、MiniMax通过港交所上市聆讯,国产大模型“第一股”或将花落上海

MiniMax 已通过港交所上市聆讯,有望成为首家进入资本市场的国产大模型公司。与传统计算机视觉企业相比,MiniMax 的核心资产主要集中在大语言模型和多模态生成技术上。这一进展也表明,资本市场对大模型商业化路径的关注度与认可度正在提升,后续或可为更多 AI 企业 IPO 提供参考。

【提要:】

🚀 MiniMax 通过港交所上市聆讯,有望成为首家登陆资本市场的国产大模型公司。

💼 其核心资产包括大语言模型与多模态生成技术,区别于传统计算机视觉企业。

📈 若成功上市,将进一步验证资本市场对大模型商业化路径的认可,并可能为后续 AI 公司 IPO 打开通道。

6、OpenAI 正式官宣:开发者可向ChatGPT提交应用程序

OpenAI 已面向全球开发者开放 ChatGPT 应用提交权限,这意味着 ChatGPT 正进一步向 AI 原生应用平台演进。开发者可依据最新指南提交应用,审核通过后,相关作品将出现在 ChatGPT 应用目录中,使 ChatGPT 获得更多可直接执行任务的能力。

image.png

【提要:】

🚀 生态大门开启:OpenAI 开放应用提交,开发者可将功能接入 ChatGPT,并面向全球用户展示。

🛒 应用目录上线:用户可通过工具菜单或访问 chatgpt.com/apps 搜索、浏览精选 AI 应用。

💰 盈利前景明确:目前支持链接外部网站交易实体商品,并计划探索数字商品变现方式。

7、千问 App 接入高德:阿里 AI 走入现实世界

千问 App 接入高德地图后,能力边界从问答继续延展到对物理世界的理解和行动。原文提到,千问可以处理更复杂的现实场景需求,并计划继续接入更多核心场景,打造可调用现实履约网络的超级入口。

image.png

【提要:】

🚀 千问 App 接入高德地图,实现从回答问题到地理空间推理的能力延展。

🧭 千问可生成可视化决策卡片,并直接唤起导航或打车服务。

🛍️ 阿里计划将千问打造为可调用现实履约网络的超级入口。

8、微软开源 TRELLIS.2:一键将图片转为高精度 3D 模型

微软开源了 TRELLIS.2。该工具面向图像到 3D 模型生成任务,可快速生成高质量 3D 模型,并支持多平台使用。原文称,在 NVIDIA H100 显卡支持下,TRELLIS.2 能在很短时间内完成高分辨率模型生成。此外,工具还提供 PBR 四件套贴图,适合电商等需要产品 3D 展示的应用场景。

image.png

【提要:】

🌟 TRELLIS.2 是微软开源的图像到 3D 模型生成工具,可快速生成高质量 3D 模型。

⏱️ 该工具在 NVIDIA H100 显卡上生成 512³ 分辨率模型仅需 3 秒,效率极高

🛒 附带 PBR 四件套贴图,方便电商用户将产品快速转为 3D 展示内容。

详情链接:https://huggingface.co/microsoft/TRELLIS.2-4B

9、xAI 推最快语音代理 API,支持中文实时搜索与情绪控制

xAI 发布 Grok 语音代理 API,主打实时语音 AI 场景中的性能和价格竞争力。原文称,该模型在音频推理基准测试中表现突出,响应速度明显快于竞品,并支持多语言自动检测、实时网页搜索和情绪控制等功能,为开发者提供实时语音交互工具。

【提要:】

🔥 Grok 语音代理 API 以每分钟 0.05 美元的价格推出,具备较强性价比。

🌐 支持包括中文在内的多种语言自动检测与自由切换,适配全球用户需求。

🧠 深度集成实时网页搜索和推理能力,让回复内容能够跟进最新资讯。

10、豆包AI眼镜明年上市!联合润欣科技、老凤祥打造 2000 元内智能穿戴新品

豆包 AI 眼镜预计将在 2025 年初上市。该产品由火山引擎提供技术支持,润欣科技负责硬件设计,并与老凤祥合作打造时尚外观。原文提到,其定价在 2000 元以内,支持实时语音助手、环境感知等场景化功能,也体现出字节跳动围绕“大模型+硬件+渠道”布局下一代人机交互入口的思路。

【提要:】

🧠 豆包 AI 眼镜依托火山引擎 RTC 技术,实现低延迟语音交互和云端协同。

💼 产品联合润欣科技与老凤祥打造,定位为融合大模型能力的亲民级 AI 眼镜。

🛒 定价 2000 元以内,预计 2025 年初上市,推动智能穿戴向更日常化的使用场景延伸。

一句话总结

本期 AI 日报的主要看点集中在模型能力迭代、AI 应用生态开放、生成式 3D 与音频工具开源,以及国产大模型企业加速走向资本市场。