MyBlog

AI 与科技日报|2026-09-29

AI 与科技日报|2026年09月29日

> 今日关键词:GPT-6 双模型、AI 安全平台、Agent 基建、生物工程评测

今日要点

  • OpenAI 发布 GPT-6 Sol 与 Luna 两款模型,主打能力与成本的不同平衡。
  • 英伟达推出 AI 安全平台,此前黄仁勋曾称 Anthropic、OpenAI 的警告“奇怪”。
  • DeepSeek 发布新论文,公开 Agent 训练沙箱 DSec,聚焦智能体“开工”难题。
  • Kimi K3 与多家应用公司推动 Agent 基建,被形容为“卷出来的”而非设计出来的。
  • 多机构联合推出 BioEVAL,面向生物工程的博士级大模型评测基准。
  • Hugging Face 博客介绍 Holo4,定位通用计算机使用智能体。
  • OpenAI 扩大与 Lenfest Institute 的合作,追加资金与算力支持。

新闻速览

OpenAI 发布 GPT-6 Sol 与 Luna
OpenAI 宣布推出 GPT-6 Sol 和 Luna 两款模型,官方描述为“将前沿智能带入日常工作”,两者在能力与成本之间采取不同的平衡策略。具体参数与定价尚未在摘要中体现。
来源:OpenAI News

英伟达推出 AI 安全平台
据 Yahoo Finance 报道,英伟达发布 AI 安全平台。此前英伟达 CEO 黄仁勋曾将 Anthropic、OpenAI 的相关警告称为“奇怪”。报道细节需查阅原文。
来源:Anthropic News / Yahoo Finance

DeepSeek 发布新论文,公开 Agent 训练沙箱 DSec
据电子工程专辑“每日瞰AI”栏目,DeepSeek 发布新论文并公开 Agent 训练沙箱 DSec;同栏目还提到骁龙 X2 携手 Googlebook 进军 Linux。
来源:电子工程专辑

DeepSeek 论文聚焦智能体“开工”难题
第一财经报道称,DeepSeek 新论文旨在解决智能体干活前的“开工”问题。与上一条或为同一研究的不同报道角度。
来源:第一财经

Kimi K3 与应用公司推动 Agent 基建
极客公园文章认为,Agent 基础设施并非自上而下设计,而是被 Kimi K3 及一批应用公司在实际需求中“卷”出来的。
来源:极客公园

BioEVAL:生物工程领域的大模型评测基准
arXiv 论文介绍 BioEVAL,由 22 个研究组、11 个生物工程子领域共同构建,包含 608 个博士级评测项,涵盖多选题与文献综述任务,旨在评估实验推理与多模态能力。
来源:arXiv cs.AI

Holo4:面向通用计算机使用智能体
Hugging Face 博客发布 Holo4 介绍,定位为驱动通用计算机使用智能体(computer-use agents)的模型。摘要信息有限,详情见原文。
来源:Hugging Face

OpenAI 扩大 Lenfest Institute 合作
OpenAI 宣布扩大 Lenfest AI Collaborative 与 Fellowship Program,追加 500 万美元资金,并提供最高 500 万美元的软件额度与工程支持。
来源:OpenAI News

趋势判断

1. 模型分层继续细化。 GPT-6 以 Sol 与 Luna 双线并行,说明头部厂商正把“能力—成本”权衡做成产品矩阵,而非单一旗舰。
2. Agent 竞争从模型转向基建。 DeepSeek 的沙箱与 Kimi K3 生态的讨论都指向同一件事:智能体能否稳定“开工”,取决于训练与运行环境,而非单纯的模型分数。
3. 评测走向垂直与高难度。 BioEVAL 这类多机构、博士级、多模态基准的出现,意味着通用榜单的说服力在下降,领域深度成为新的衡量标尺。

—

编辑点评: 今天最值得关注的不是某个模型跑分,而是“怎么让智能体真正干活”这件事被反复提起。基建、沙箱、评测,三条线正在合流。