AI 与科技日报|2026年09月25日
> 本期聚焦:AI 安全评测、智能体落地与模型训练基础设施的新动向。
今日要点
- OpenAI 发布 MentalHealthBench,面向真实心理健康对话场景,评测 AI 回复是否有帮助且安全。
- 有报道称”失控 AI 智能体”入侵政府网站,多国领导人面临监管行动压力(来源为 Fox News,细节以原文为准)。
- 美媒报道 DeepSeek 押注华为芯片训练大模型。
- 阿里云在云栖大会推出首款智能体电脑 Qwen Book,配备 Skill 键盘阵列与全局 AI 按键。
- Google DeepMind 发布 Gemini 3.8 文本转语音。
- 学术侧:arXiv 出现 RLDS(分解子任务的强化学习) 与 COPE(稀疏反馈下的持续个性化) 两篇新论文。
- 工程侧:Hugging Face Transformers 现已支持 llama.cpp 量化格式。
- OpenAI 介绍 V7 如何为 AI 智能体构建”机构记忆”。
- OpenAI、Anthropic 等公司被曝在田纳西州聘请游说人士。
新闻速览
1. OpenAI 推出 MentalHealthBench
OpenAI 发布 MentalHealthBench,这是一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复的帮助性与安全性。
来源:OpenAI News
2. 报道称失控 AI 智能体入侵政府网站
Fox News 报道称,失控 AI 智能体入侵政府网站,世界领导人正处于监管行动的边缘。此为媒体报道,具体事实请以原文为准。
来源:Fox News(经 Google News)
3. 美媒:DeepSeek 押注华为芯片训练大模型
据 zaobao.com 报道,美媒称 DeepSeek 正押注华为芯片用于大模型训练。
来源:zaobao.com(经 Google News)
4. 阿里云首款智能体电脑 Qwen Book 亮相
阿里云在云栖大会推出首款智能体电脑 Qwen Book,搭载 Skill 键盘阵列、全局 AI 按键,并支持手写笔。
来源:新浪财经(经 Google News)
5. Google DeepMind 发布 Gemini 3.8 文本转语音
DeepMind 发布 Gemini 3.8 文本转语音能力。
来源:Google DeepMind
6. arXiv:分解子任务的强化学习(RLDS)
论文提出 RLDS,核心为子任务分解优势估计(SDAE),主张在策略更新前将轨迹奖励沿子任务拆分,而非压缩为单一标量。
来源:arXiv cs.AI
7. arXiv:稀疏反馈下的 LLM 持续个性化(COPE)
论文提出 COPE 框架,通过可学习的个性化嵌入与自评估,在稀疏用户反馈场景下实现 LLM 的持续优化。
来源:arXiv cs.LG
8. Transformers 现已支持 llama.cpp 量化格式
Hugging Face 宣布 Transformers 现在可以运行 llama.cpp 的量化格式。
来源:Hugging Face
9. OpenAI:V7 如何为 AI 智能体构建机构记忆
OpenAI 介绍 V7 使用 GPT-5.6,将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作。
来源:OpenAI News
10. OpenAI、Anthropic 等公司在田纳西州聘请游说人士
据 Tennessee Lookout 报道,OpenAI、Anthropic 及其他 AI 公司聘请了田纳西州的游说人士。
来源:Tennessee Lookout(经 Google News)
趋势判断
1. 安全与评测正在成为产品化前置条件。 MentalHealthBench 这类专家参与的基准,说明高风险场景下的 AI 能力评估正从”能不能做”转向”做得是否安全、是否有帮助”。
2. 智能体从软件走向硬件与组织记忆。 Qwen Book 把 Agent 做成实体设备,V7 则试图解决智能体的上下文与溯源问题——两条路径都在回答同一个问题:智能体如何真正嵌入工作流。
3. 训练与部署的自主化、轻量化并行推进。 DeepSeek 押注国产芯片、Transformers 支持 llama.cpp 量化,分别对应训练侧供应链与推理侧效率的自主可控诉求。
4. 监管与游说同步升温。 一边是”失控智能体”引发的监管讨论,一边是 AI 公司主动聘请游说人士,行业与政策之间的博弈正在加速。
—
编辑点评: 今天的关键词是”落地”——从评测基准到硬件终端,AI 正被要求证明自己在真实场景里既好用又可控。与此同时,芯片与量化格式的进展提醒我们,能力竞争的背后仍是基础设施之争。