欢迎查看本期【AI日报】。本栏目聚焦人工智能行业近期动态,覆盖模型发布、开源项目、开发者工具与AI应用进展,帮助读者快速把握重要信息。
新鲜AI产品点击了解:https://app.aibase.com/zh
今日重点
本期AI日报关注多项重要进展:9月1日起《人工智能生成合成内容标识办法》正式强制实施;美团开源LongCat大模型,面向开发者提供新的AI应用基础模型选择;阶跃星辰发布开源端到端语音大模型Step-Audio 2 mini,并在多项国际基准测试中取得SOTA成绩。
1、阶跃发布端到端语音大模型Step-Audio 2 mini
阶跃星辰推出并开源端到端语音大模型Step-Audio 2 mini。该模型在多个国际基准测试中取得SOTA表现,能力覆盖音频理解、语音识别、跨语种翻译以及语音对话等方向。
与传统“ASR+LLM+TTS”的三级处理链路不同,Step-Audio 2 mini采用端到端架构,可从原始音频输入直接生成语音回复。模型还结合链式思维推理与强化学习进行优化,以提升对情绪、语调、音乐等副语言信息的理解能力,并增强自然回应效果。

【AiBase提要:】
🔥 Step-Audio 2 mini在多个国际基准测试中取得SOTA成绩,性能超过Qwen-Omni、Kimi-Audio等开源模型。
🧠 模型采用端到端多模态架构,突破传统ASR+LLM+TTS三级结构,有助于实现更简洁、低时延的音频处理。
💡 通过链式思维推理与强化学习联合优化,模型提升了对情绪、语调、音乐等副语言信息的理解和自然回应能力。
详情链接:https://github.com/stepfun-ai/Step-Audio2
2、9月1日AI内容新规正式生效!不标识就违法
《人工智能生成合成内容标识办法》自9月1日起进入强制实施阶段,这标志着中国在AI生成内容治理方面进一步走向制度化、规范化。
根据新规要求,AI生成合成内容需要同时设置显式标识和隐式标识,以增强内容来源透明度,并降低虚假信息传播带来的风险。

【AiBase提要:】
✅ 显式标识要求在AI生成的文本、图片、视频和音频中作出明确说明,提升内容辨识度。
🔍 隐式标识则通过数字指纹等方式写入元数据,增强内容溯源和监管能力。
⚖️ 违规可能面临限流、整改、下架等处理,并承担相应法律风险,推动AI产业规范发展。
3、美团推出开源大模型LongCat:旨在赋能开发者,加速AI应用落地
美团发布开源大模型LongCat,为开发者构建AI应用提供新的模型选择。该模型采用混合专家架构,可按需激活部分参数,从而提升计算效率。
从基准测试表现来看,LongCat在多个任务中取得较好成绩,显示出面向实际应用场景的潜力。

【AiBase提要:】
🧠 LongCat-Flash拥有560亿参数,采用混合专家(MoE)架构,通过动态激活部分参数优化计算效率。
🚀 模型支持超过100个标记每秒的推理处理能力,具备低延迟和较高扩展性。
📊 LongCat在MMLU、数学推理等任务中表现优异,显示出面向实际应用的潜力。
详情链接:https://longcat.chat/
4、上海AI实验室发布多模态大模型书生·万象 InternVL3.5
上海AI实验室发布多模态大模型InternVL3.5。该模型在架构与训练机制上进行了升级,引入级联式强化学习、动态视觉分辨率路由以及解耦部署架构。
这些改进主要面向推理能力、部署效率和通用能力提升。根据原文信息,InternVL3.5在多个基准测试中表现突出,并超过GPT-5和Claude-3.7-Sonnet等主流模型。

【AiBase提要:】
✨ InternVL3.5采用级联式强化学习框架,提升模型推理性能。
🖼️ 模型支持多种视觉分辨率,并对响应速度进行了优化。
🚀 提供不同参数规模的模型,以适配多种资源条件和使用场景。
详情链接:https://github.com/OpenGVLab/InternVL
5、腾讯ARC开源音频模型 AudioStory:用大语言模型生成长音频
腾讯ARC团队推出AudioStory模型,将大语言模型能力与音频生成技术结合,面向长篇叙事音频生成场景。
AudioStory能够生成具备结构化表达和时间一致性的长音频内容,在指令跟随能力和音频质量方面表现较好,可应用于视频配音、长音频生成等任务。

【AiBase提要:】
🎧 AudioStory是一款基于大语言模型的长篇叙事音频生成模型,支持多种音频任务。
📊 模型具备较强的指令跟随能力,能够生成连贯的音频叙事内容。
🛠️ 团队已公开推理代码,并展示多个应用案例,体现其在视频配音和长音频生成方面的应用价值。
详情链接:https://github.com/TencentARC/AudioStory
6、OpenAI发布GPT-realtime,语音交互自然度进一步提升
OpenAI发布GPT-realtime语音模型,重点提升语音自然度与情感表达能力。该模型可以模拟人类语调、情绪变化和语速变化,使语音交互更接近真实对话。
GPT-realtime还支持多模态处理,并可根据不同使用场景实时调整语音风格,为语音AI交互提供新的实现路径。

【AiBase提要:】
🚀 GPT-realtime提升了语音交互的自然度,能够还原更多人类语音细节。
🧠 模型支持多模态处理,可结合图像和语音信息进行分析与响应。
💡 支持切换多种语音风格,适应不同场景下的个性化交互需求。
7、Meta与UCSD推出DeepConf,AI推理准确率达99.9%
Meta与加州大学圣地亚哥分校(UCSD)联合推出DeepConf技术。该技术面向高难度推理任务,在相关任务中实现99.9%的准确率,同时将计算资源消耗降低84.7%。
DeepConf的核心在于引入“置信度”机制,使AI系统能够根据题目情况动态调整解题策略,从而兼顾推理准确性与计算效率。

【AiBase提要:】
🔍 DeepConf在高难度推理任务中实现了99.9%的准确率。
💡 该技术将计算资源消耗降低了84.7%,有助于减少运算成本。
🚀 借助“置信度”机制,AI可以动态调整解题策略,提高推理效率。
详情链接:https://arxiv.org/abs/2508.15260
8、马斯克承认xAI代码库遭窃,前员工转投OpenAI
马斯克承认xAI代码库遭到窃取。事件涉及xAI前员工Xuechen Li,其被指控窃取商业机密,并在离职后加入OpenAI,引发科技行业关注。
【AiBase提要:】
💻 前员工Xuechen Li被指控窃取xAI商业机密,并在离职后加入OpenAI。
🔒 xAI要求法院禁止Li在OpenAI工作,同时要求其归还被盗数据。
🚀 据原文,Li离职前套现近700万美元,其行为可能为OpenAI节省数十亿美元研发费用。
9、阿里巴巴Qwen团队发布GUI自动化框架Mobile-Agent-v3和GUI-Owl
阿里巴巴Qwen团队推出Mobile-Agent-v3和GUI-Owl两项产品,聚焦图形用户界面(GUI)自动化任务中的理解与执行问题。
两者结合多模态模型能力与多代理协作机制,以提升GUI任务的理解、规划和执行效果,并展示出跨平台完成相关任务的能力。

【AiBase提要:】
🧠 GUI-Owl是阿里巴巴推出的多模态代理模型,融合感知、推理和执行能力,可适应复杂GUI环境。
🤖 Mobile-Agent-v3支持多代理协作,并通过动态更新计划提升任务执行效率。
📊 两款产品在GUI自动化基准测试中表现出色,体现了阿里巴巴在自动化领域的进一步探索。
详情链接:https://arxiv.org/abs/2508.15144
10、微软推出Copilot Labs,首个实验性工具“Copilot音频表达”上线
微软推出实验性AI中心Copilot Labs,邀请用户参与AI产品探索和后续发展。该平台首个上线的实验性工具为“Copilot音频表达”。
“Copilot音频表达”可将书面文本转换为自然流畅的语音旁白,并提供情感模式和故事模式,让用户能够对生成语音的表达效果进行更细致控制。

【AiBase提要:】
🌟 Copilot Labs面向用户开放AI创新实验,体现了微软在AI产品方向上的持续探索。
🔊 “Copilot音频表达”是该平台推出的首个实验性工具,可把文本转为自然语音,并支持情感模式和故事模式。
🌐 工具在全球范围内免费开放,但部分功能需要登录Microsoft账户并拥有Copilot Pro订阅。
详情链接:https://copilot.microsoft.com/labs/experiments/audio-expression
11、小红书自动化工具xiaohongshu-mcp上线,支持内容发布与数据获取
xiaohongshu-mcp是一款基于MCP协议的开源工具,面向小红书平台提供自动化登录、内容发布和数据获取能力。
该工具可与AI客户端集成,用于简化相关操作流程,同时具备一定扩展能力,适合内容创作者和开发者使用。
【AiBase提要:】
🔐 智能登录,持久化体验:首次扫码登录后,后续操作无需重复登录。
🖼️ 图文发布功能已上线,后续计划扩展视频发布和数据分析能力。
🛠️ 工具使用Go语言开发,代码结构清晰,便于二次开发,并支持通过GitHub克隆部署。
详情链接:https://github.com/xpzouying/xiaohongshu-mcp
一句话总结
本期AI日报显示,AI内容合规进入强制标识阶段,同时语音、多模态、GUI自动化和开源大模型等方向继续加速推进,开发者与应用生态获得更多工具和模型选择。
