(来源:图灵人工智能)
转自AI趋势全天候,仅用于学术分享,如有侵权留言删除AI 教母李飞飞 用了很强烈的语气推荐这篇报告——“每个研究型大学的校长都应该读”!未来做研究只有两种实验室:一种 token 充足,另一种 token 匮乏。
恰好这篇文章也是周一原本我应该发送推荐给大家的。于是我重新编辑了一下,并把全文翻译放在文末。
为什么当时推荐它?本身我最近几个月也在用自己的项目做 tokenmaxxing 实验(每月 codex 单账号 100 亿 token)——如果我所有想法都可以让 AI 执行的,那实际上业务会推进到哪一步?
在 OpenAI 透露的内部数据里,就有相关的定量数据。
第一,使用强度已经到了什么程度?
到 8 月中旬,研究人员每天的推理使用量,按 API 价格折算,中位数超过 600 美元,第 90 百分位超过 7000 美元。智能体累计运行时间达到人类工作时间的约 3.1 倍,同时运行至少四个智能体的人也越来越多。
3.1 倍不等于生产率,但工作方式的变化很清楚:一个人开始把工作分出去,让多个智能体并行执行。企业如果还只统计员工有没有打开 AI,恐怕没量到关键变化。
第二,更多使用已经伴随更多实际活动。
今年第三季度截至 8 月 15 日,全公司每位活跃代码贡献者的日均代码改动量,达到 2025 年前平均水平的 7.02 倍。8 月,每位活跃实验者的实验数量,也创下自 2025 年 1 月追踪以来的新高。
代码改动量不等于有效产出,实验增长也有算力增加的贡献。
但智能体还在接手答疑、监控和排障,有团队甚至因为参与人数下降,停止了固定答疑活动。很多工作就卡在等人回答、查问题上,AI 已经在改变这些环节。
第三,复杂任务能交出去,人仍然关键。
过去六个月,在预计人类需要 4—8 小时完成的成功任务中,超过一半至少有一次人工介入。
我觉得最容易被忽略的,是我们开始需要把 AI 当作协作者。而不是只是帮一下的自动化工具。很多人其实忽略这个差别。我直接把原文编译放在后面,大家自行评判!
研究加速:OpenAI 内部视角
为了让通用人工智能造福全人类,我们相信它必须接受民主治理。这只能通过公众在充分知情的基础上,就高度先进人工智能系统的能力、风险和保障措施展开辩论来实现。世界各地的人们都需要了解前沿人工智能未来可能的发展轨迹,这样他们才能在其发展方向上拥有有意义的话语权。
对具体风险、事件和保障措施保持透明是必要的,但还不够。我们认为,公众还需要了解最强大的系统是如何发展的,以及它们如何在前沿实验室内部推动研究进展。
我们的目标是安全地构建一名可在人类监督下工作的自动化 AI 研究员,进一步推动深度学习与对齐研究,并实现迭代改进。根据我们的测量结果,我们现已实现去年秋天宣布的目标:到今年 9 月拥有一名自动化研究实习生。所谓“研究实习生”,是指能够在人类指导下执行定义明确的研究任务的系统,其中包括熟练研究人员需要花费数天才能完成的任务。在争取到 2028 年 3 月打造出自动化 AI 研究员的道路上,我们正取得显著进展。
今年以来,OpenAI 研究人员的日常工作发生了显著变化。研究人员在一天的工作中持续使用编程智能体(通常同时开展多个会话),总体使用量迅速增长,增速超过了 OpenAI 的其他团队。研究人员提交代码的速度更快,开展的实验也更多。研究人员使用智能体的方式也在变化:智能体正在处理越来越复杂的任务,而且成功完成任务的比例也在提高。AI 研究是一个复杂的过程,存在许多潜在瓶颈,因此整体研究进展很可能赶不上这些具体指标的增长速度。但总体而言,这些发现与我们内部许多人的整体感受一致:智能体工具正在切实加快研究进展。研究重点仍由人来确定,哪些想法和结果值得继续推进仍由人来判断,是否扩大系统规模、暂停或部署系统,也仍由人来决定。
如果以负责任的方式开展,我们相信自动化 AI 研究将产出能够直接提升人类福祉、推动 OpenAI 实现使命的模型。它可以降低先进智能的成本,使世界各地的人们都能从中受益。我们开展这项工作,部分原因是自动化研究可能帮助我们解决对齐问题,并建立针对能力日益增强的 AI 的防御措施。自动化 AI 研究员也可以成为自动化安全或对齐研究员。能力更强且符合对齐要求的系统,可以帮助保护关键基础设施,抵御危险的 AI 智能体,并开发新的防护措施。
这些都是发展有用的自动化研究能力的理由,但并不意味着快速递归自我改进(RSI)一定是我们应当追求的结果。是否推进、如何推进,必须取决于我们能否保持人类控制,以及人们在充分了解收益与风险后作出的民主选择。
我们尚不知道如何安全地实现完全的递归自我改进(RSI),并确保系统保持对齐。我们正在努力让对齐和安全措施跟上能力的提升。但我们不能假设对齐与安全方面的进展一定能跟上,而且能力更强的系统可能会更难监控。审慎开展对齐和安全工作,是这项工作的核心;起点是衡量并缓解当前编程智能体系统中已经出现的安全问题。每当我们发现继续推进会带来不可接受的安全风险时,都会采取适当措施;对于无法充分保障其安全的系统,这些措施包括放缓或停止开发或部署。
在最近的 Hugging Face 事件之后,我们 将这一承诺付诸行动 ,暂停了对我们计划部署的最新模型进行强化学习(RL)训练,同时进一步加固并对我们的研究环境开展红队测试,扩大监测系统的覆盖范围。这并未停止所有研究:部分工作负载在更严格的控制措施下恢复,而其他工作负载仍处于暂停状态。我们提高了安全与对齐标准,并将安全工作更深入地纳入模型生命周期,要求在整个训练过程中提供更有力的证据证明模型行为符合对齐要求。
今天,我们将详细介绍智能体系统在近几个月中如何推动我们朝着递归自我改进(RSI)迈进。智能体系统是新兴且快速变化的,我们的测量工作仍处于初步阶段。通过分享这些早期结果及其背后的方法,我们旨在让公众了解相关情况,鼓励形成公开披露的规范,并帮助该领域朝着共享的测量标准迈进。
归根结底,正如我们在 前沿政策蓝图 中所写,我们认为,应要求我们和其他公司公开追踪我们在实现 RSI 方面的进展。即使没有这样的要求,我们也计划继续透明地披露我们的 RSI 进展。随着我们的测量技术和理解不断改进,我们将调整透明度方法,同时兼顾保护安全和专有信息的需要。
1. 编程智能体正在重塑 OpenAI 研究人员的日常工作
今年年初,如果按智能体使用量对 OpenAI 的研究人员排序,处于中位数的研究人员对编程智能体的使用还不多。到 8 月中旬,处于中位数的研究人员已将智能体融入日常工作,其每天使用的推理量按 API 价格折算超过 600 美元。在我们的研究部门中,使用量处于第 90 百分位的用户,如今每天使用的 token 按这一价格口径折算超过 7,000 美元。
2026 年 6 月之前,整个研究部门中智能体的总运行时间仍少于人员的总工作时间。此后情况发生了变化。按每天 8 小时的标准工作日折算,截至 8 月中旬,整个研究部门每投入 1 个人类工作日,对应的智能体运行时间已达到 3.1 个工作日。
按工作日折算,自主智能体的总运行时长如今已远超研究人员的总工作时长
另一个观察角度是:有多少研究人员采用高并发工作方式,例如同时运行 4 个或更多智能体。如下所示,这一人数正在增加。这里统计的是每日并发运行数量的峰值,既包括用户直接启动的智能体,也包括这些智能体随后创建的子智能体。
2. 研究人员编写的代码更多,开展的实验也更多
AI 研究中的大量工作都可以看作一个劳动密集型过程,其目标是把提升模型智能或性能的新改进,整合到我们的某个核心模型中。这一过程涉及许多步骤,只有各个步骤都顺利完成并相互配合,能力才会提升:研究人员需要设计新的改进方案,编写评测来判断模型表现,编写基础设施代码以大规模测试这些改进,在训练过程中找出程序错误以及不安全或不符合对齐要求的行为,并将经过验证的有效想法纳入核心模型的一次训练任务。研究过程中任何一个环节出问题,都可能制约整个研究循环。
编写代码和开展实验是研究人员工作中的两项主要活动,我们看到证据表明这些过程正在加速。
这些指标相对容易测量,却可能很难解读。随着自动化推进,最难自动化的任务将占据研究人员更大比例的精力,并成为未来研究进展的重要瓶颈。算力也是制约进展的因素之一;随着其他瓶颈减弱,它的重要性可能进一步上升。
2026 年以来,每位活跃实验人员开展的实验数量有所增加,2026 年 8 月达到自 2025 年 1 月开始追踪以来的最高水平。这与 Codex 使用的普及存在相关性,不过我们也注意到,自 2025 年以来,可用算力同样大幅增加。
实验开展速度已经提高
3. 研究人员使用智能体开展工作的方式正在改变
定性观察和内部数据均表明,研究人员交给编程智能体的任务类型构成正在变化:他们越来越多地把更高层次、完成周期更长的任务交给智能体。
为了更清晰地了解这一趋势,我们采用 Epoch AI 近期发布的分类体系,分析了研究部门近期的智能体使用情况。该体系对 AI 研发生命周期中的各类工作进行分类,借鉴了长期用于职业与工作分类的 O*NET 系统,并针对前沿 AI 研发进行了专门设计,将研发过程划分为六个主要阶段:
决策:开展什么工作、继续哪些工作、向哪里分配资源
设计:研究思路和工程规范
构建:代码和数据集
运行:训练与评测任务、硬件、模型服务
分析:实验、模型、部署、外部工作
沟通:研究发现、反馈、进展状态、决策
下面,我们按照这一体系,对编程智能体产生的 token 进行分类。
研究人员正在以新的方式使用编程智能体
自年初以来,所有类别的研究活动均有所增加。
我们看到,2026 年 1 月至 8 月,各类研究活动都有所增加。1 月份,占主导地位的是研究代码与基础设施代码。这一类别的使用量继续增长,其他类别也明显增加,尤其是技术支持和运行监控。高层规划仍然只占智能体输出 token 的极小一部分。
据同事们的非正式反馈,编程智能体在排查内部研究基础设施的问题方面表现出色,缓解了研究进展中的一个重要瓶颈。此前,多个团队会定期安排答疑,帮助研究人员排查实验问题。这些团队发现,2026 年参加答疑的人数有所下降,其中一个团队已完全停止答疑活动,转而专注于其他系统改进。
这里,我们绘制了一个主要内部技术支持频道中每日新发主帖的数量,不包括帖子下的回复。研究人员会在该频道向其他团队求助。据我们所知,该频道活动量的下降,并没有伴随着求助转移到另一个由人工提供支持的技术频道。这种求助量的下降,与前面提到的整体转变一致。
我们还可以考察编程智能体是否成功完成了研究人员交给它们的任务。借助基于智能体的分类器,我们发现,在能够确定实际结果的任务中,从 1 月到 7 月,多个难度档位的成功率总体上有所提高。这里用人类完成任务所需的预计时间,作为衡量难度的替代指标。不过,智能体仍然需要相当程度的人工引导才能成功,任务越复杂,越是如此。
在过去 6 个月里,成功完成的、预计需要人类花费 4 至 8 小时的任务中,超过一半涉及至少 1 次人工干预。
智能体完成研究人员所交付任务的成功率随时间推移而提高。图中排除了结果无法确定的分类,以及会话数少于 50 或独立用户数少于 50 的数据点。
1 月至 7 月的任务成功率和干预率,按预计由人类完成任务所需的时长分组。不包括结果无法确定的分类。
4. 调整模型开发节奏
要开发能力更强的系统、实现安全且有益的 AGI,研究进展也取决于能否具备这类工作所需的保障措施。随着我们对风险的了解加深,对于需要哪些保障措施的判断也可能改变。
正如我们所述, 我们最近更新了监控、对齐和安全方面的标准。这里,我们展示了最近的限制如何影响研究活动的一个方面。
安全相关限制下的强化学习(RL)算力调整
*此处显示的 7 月 20 日至 8 月 6 日期间的大部分 Astra 算力,旨在测试安全性和安保改进措施的实施情况。
7 月 20 日,在发现智能体已攻破我们的研究基础设施后,我们暂时关闭了用于训练的容器服务,随后在显著加强限制措施后恢复了该服务。
这导致强化学习训练所用的算力大幅下降,各团队需要重新配置工作流程,以适应加固后的研究环境。上图涵盖了我们计划部署的最新模型暂停强化学习训练两周的时期。7 月 20 日至 8 月 6 日的 Astra 类模型强化学习实验中,按分配的 GPU 资源衡量,大部分运行任务都是为了测试安全与安保改进措施的落实情况。
8 月 7 日,初步证据表明,按照我们的 Preparedness Framework(前沿风险应对框架),Astra 的网络能力可能已达到 Critical 等级。这些证据促使我们进一步实施针对该模型的安全限制,要求 Astra 在安全级别更高的研究环境中运行。在随后一周,分配给 Astra 类模型的 GPU 资源进一步减少了 59.2%,而分配给其他类别模型的资源增加了 17.2%。
后者的增加抵消了前者约 85% 的降幅,使本次分析所涵盖的强化学习工作负载获得的 GPU 资源总量基本不变。这一变化与如下情形相符:涉及 Astra 的工作受到限制后,部分训练和实验转向了非 Astra 模型。研究人员的非正式反馈也与此一致:对于无法再用于受新限制约束的工作负载的算力,他们找到了其他用途。
这些数据为围绕训练与安全的持续讨论提供了一个有用信号:引入新的管控措施后,算力仍然有价值,也能灵活调配,因此会自然地转用于研究中的其他工作。从长远看,讨论 AI 的进展速度时,也应该考虑如何更好地利用那些受到新管控措施或拟议管控措施约束的算力。
5. 前路
在确保对齐的前提下推动递归自我改进(RSI),并理解这一进程,对我们的使命至关重要。我们将继续完善衡量方法,报告不断深化的认识,推动公众在充分知情的基础上展开讨论,并推动对前沿系统实施有实质意义的民主治理。
附录:我们撰写这篇文章所采用的方法
由智能体驱动的 AI 研究仍处于起步阶段,我们还在探索如何衡量它。一些指标,例如研究团队生成的代码量,相对容易收集,却很难解读,因为它们与研究进展之间的关系尚不确定。更直接衡量研究进展的指标,例如智能体成功完成研究人员交付任务的比例,可能更有用,但设计和验证起来都很复杂。研究人员所依赖的工具和系统也在快速变化,这进一步增加了衡量的难度。加深对研究加速的理解,是整个 OpenAI 的一项工作重点。
在这些分析中,除非另有说明:
“研究人员”在这里是一个宽泛称谓,指研究部门的所有成员,包括部分负责构建研究基础设施、管理研究项目或以其他方式支持研究工作的人员。
由于研究人员依赖的工具和系统快速变化,编程智能体的使用指标涵盖了大部分使用情况,但并非全部。