MyBlog

AI 与科技日报|2026-10-03

AI 与科技日报|2026年10月03日

今日要点

  • OpenAI 发文探讨”执行层”价值,认为先进 AI 对突破性创意背后的日常工作影响最大。
  • Anthropic 被报道正培训 10,000 名工程师,将 Claude 部署进全球大型企业。
  • DeepSeek Harness 官方桌面端实测流出,主打免命令行、开箱即用的办公助手体验。
  • Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef。
  • 学界动态:arXiv 出现关于 SLM 微任务适配缺口、金融时序双路径模型的研究;BAIR 探讨让 LLM 更新信念以支持长程交互。

新闻速览

OpenAI:先进 AI 或最利好”执行层”
OpenAI 发布文章《The eternal complement》,提出先进 AI 可能对突破性创意背后的日常工作最为关键,并探讨执行环节如何塑造下一阶段的经济与进步节奏。
来源:OpenAI News

Anthropic 被曝培训万名工程师部署 Claude
据 Yahoo Finance 报道,Anthropic 正在培训 10,000 名工程师,目标是把 Claude 安装进全球最大的企业之中。
来源:Yahoo Finance

DeepSeek Harness 桌面端实测:不用命令行
搜狐网发布 DeepSeek Harness 官方桌面端实测,称其无需命令行启动、常用功能开箱即用,从自动整理桌面到自写”猫猫插件”,并对比了它与 Codex 的使用差异。
来源:搜狐网

Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef
新浪财经消息,Cloudflare 发布开源多模态决策模型 Clef,其构建基于 Qwen。
来源:新浪财经

arXiv:现成 SLM 能否胜任 Agent Harness 的微任务?
论文《Measuring the Microtask Eligibility Gap》构建了 4 类微任务基准(如自动批准 shell 命令、写记忆、选工具、排序历史轮次),并扫描 Qwen3 0.6/1.7/4/8B 在 FP16 下的表现,发现存在”资格缺口”。
来源:arXiv:2610.00025

arXiv:DualCast 双路径语言模型用于金融时序预测
DualCast 以冻结语言模型为基础,扩展离散金融词表,用学习到的摘要 token 与三个残差形状 token 表示每段对数收益,并提出自适应频率均衡残差向量量化以提升码本利用率;快路径仅在冻结的 Qwen3-8B 主干上训练新嵌入与输出头。
来源:arXiv:2609.38197

BAIR:教 LLM 更新信念以支持高效长程交互
伯克利 BAIR 发布研究,探讨让 LLM 学会更新信念,从而在长程交互中更高效。
来源:BAIR Research

Hugging Face:AutoSynthData 为企业 Agent 生成训练数据
Hugging Face 博客发布 ServiceNow AI 的 AutoSynthData 内容,主题是为企业级 Agent 生成训练数据。
来源:Hugging Face

OpenAI:Albertsons 用 ChatGPT Enterprise 与 API 重塑零售
OpenAI 案例显示,Albertsons 正使用 ChatGPT Enterprise 与 OpenAI API,帮助团队更快工作,并让数百万顾客的购物更便捷。
来源:OpenAI News

趋势判断

今天的几条线索指向同一个方向:AI 的竞争重心正从”模型能力”转向”落地执行”。OpenAI 谈执行层价值、Anthropic 培训万名工程师做企业部署、DeepSeek 把 Harness 做成开箱即用的桌面端,本质上都是在解决”最后一公里”问题。

与此同时,小模型与微任务分工正在被认真对待。arXiv 那篇关于 SLM 微任务资格缺口的研究,恰好呼应了 Agent Harness 的现实需求——不是所有环节都需要前沿大模型,但哪些微任务现成小模型能扛住,目前仍有明显缺口。

开源与生态绑定同步加速:Cloudflare 基于 Qwen 做 Clef,DualCast 基于 Qwen3-8B,Qwen 正成为被反复选用的底座之一。

—

编辑点评:今天的新闻里,”能不能用”比”有多强”更抢镜——企业部署、桌面端、微任务分工都在回答落地问题。模型底座趋于集中,而真正的差异化正转移到执行层与工程化能力上。