炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
2025年11月,谷歌把最新的Gemini 3 Pro丢给一群真正的科学家去用。其中一位复杂性理论学家干了件很朴素的事:他有个证明过的定理,一直没时间写成论文,就让AI帮他"顺手"整理一下。
结果挺有意思。AI用八轮对话就搞出了一份规划文档和一份初稿,把证明细节、行文组织全包了。听起来像是AI已经能独立干科研的活了?
但故事没这么简单。就在AI起草的过程中,这位学者发现了一处关键的技术背景遗漏,还揪出了某个引理里一个错误的假设。
如果没有这次人工介入,这篇论文极可能就是一篇看起来严谨、实际上有硬伤的错误论文,堂而皇之地流入学术圈。
这就是这篇论文想告诉你的核心事实:现在的AI科学家研究,几乎全部在讨论"AI能自己做多少",却很少有人认真讨论"人和AI搭伙干活时到底发生了什么"。而后者,恰恰是决定这些系统能不能真正用好的关键。
这篇论文的作者来自美国几家国家实验室和伦斯勒理工、约翰霍普金斯大学,他们的立场很直接:研究AI科学家,不该只盯着AI一个人的能力,得把人和AI当成一个整体系统来看。
科学早就是团队运动,AI闯进来了
先说个背景常识,可能会颠覆你对"科研"的印象。
现代科学早就不是爱因斯坦一个人在纸上推公式的时代了。有研究统计过,团队合作产出的论文,被高频引用的可能性是独立作者的6.3倍。
这个数字意味着什么?意味着如果你是个博士生,选择单打独斗还是加入团队,几乎决定了你的论文能不能被人记住。科学早就变成了一项高度依赖协作的社会活动。
现在的问题是,LLM智能体正在冲进这个协作网络,扮演的角色越来越不像"工具",越来越像"同事"。
**大语言模型智能体**:能感知信息、进行推理、并采取行动的AI系统,论文里简称为"智能体"
这些被称为"AI科学家"的系统,正朝着一个方向狂奔:自主性越来越高,人类的判断和监督越来越少。学术界大量的论文标题都在畅想AI独立完成从假设提出到论文发表的全流程。
作者们做了件挺扎实的事:他们系统梳理了现有的AI科学家系统,看看这些系统到底给人类留了多少插手的空间。结果发现,绝大多数系统只允许人类干两件事:一开始提个研究方向,最后检查一下成果。
这中间发生了什么,人类几乎看不见,也管不着。
人类到底能在AI科学家的工作流里插多少手?
作者们建立了一套分类体系,把现有的AI科学家系统按照"人类反馈能从哪个环节进入"分成了四个层级。
第一层是**产出物层面反馈**:人类只能在AI科学家交出最终成果(比如一篇完整论文)之后才给意见,属于"事后诸葛亮"式的介入
像大名鼎鼎的"AI Scientist v2"、CycleResearcher这些系统,走的都是这条路子。整个从想法到实验到写论文的流程AI一条龙包办,人类只需要在开头说一句"我想研究这个",结尾再检查一下成品行不行。
这就好比你把整个装修工程外包给施工队,从设计图纸到砌墙贴瓷砖全权交给对方,你只在开工前提一句"我想要现代简约风",然后等交房那天去验收。如果施工队半路把承重墙拆了,你根本没机会在过程中发现——因为你压根没进过工地。
这类系统数量最多,说明目前学术界默认的AI科学家范式,就是"给个题目,交个成果"。
第二层是**发现阶段层面反馈**:人类可以在文献调研、假设生成、实验、论文撰写这几个大阶段之间的"关卡"上停下来审查
谷歌的Co-Scientist系统就是这类的代表,它搞了个"生成-辩论-进化"的锦标赛机制,让多个假设互相PK,科学家可以在每一轮之间介入调整方向。这套系统据说已经在药物再利用和抗生素耐药性研究上产出了经过实验验证的真实发现。
第三层是**研究规划层面反馈**:人类在AI真正动手之前,先参与规划环节,把关整个行动方案
这类系统更像是"先商量好怎么干,再放手让AI去执行"。El Agente Q这个量子化学AI系统就是这个路数,人类扮演的是"定战略"的角色,而不是"看结果"的角色。
第四层,也是数量最少的一类,叫**异步引导与打断**:允许人类在AI工作的任意时刻随时插话、纠正、打断,不受阶段边界限制
FreePhDLabor这个系统能做到实时打断,把纠正意见直接写进AI的持久记忆里。这已经很接近人类团队真实协作的样子了:谁都可能在任何时刻喊一声"等等,这里不对"。
四层反馈机制放在一起看,你会发现一个清晰的趋势线:反馈越是"实时、精细、随时可打断",系统数量就越少。目前大部分AI科学家系统,本质上还是把科研当成一个"黑箱优化问题"在解决,人类只负责设定目标函数和最后打分。
实测:AI科学家真的知道什么时候该问人吗?
光靠文献综述总归有点隔靴搔痒,作者们干脆自己动手做了个小实验,挺扎实的一个细节。
他们用了一个基于ReAct框架、搭载GPT-5-mini的AI科学家智能体,放到AstaBench这个基准测试套件里,专门测试"端到端科学发现"任务。
**ReAct框架**:一种让AI智能体交替进行"推理"和"行动"的工作模式
他们设计了三种对照条件。第一种是啥都不加,用AstaBench默认的规划型智能体。第二种是给智能体加了个"问用户"的工具,并且把人类反馈的分类知识写进系统提示词里,鼓励它主动求助。第三种更激进,直接要求智能体每走一步都必须先问一下用户。
结果相当扎心。
在第一种条件下,智能体压根不会主动向人类求助,一次都没有。它遇到关键资源缺失、情况模糊的时候,选择的策略是自己瞎猜一个假设往下走,而不是停下来问人。
第二种条件下,就算专门鼓励了,智能体全程也只问了一个问题。
第三种条件下强制要求每步都问,问题数量一下跳到92次,但端到端任务得分反而从0.39掉到了0.24。
这组数据说明了一件挺重要的事:现在的AI智能体既不太会主动判断"什么时候该向人求助",强行让它每步都问又会拖累效率,把任务做得反而更差。这中间没有一个自然的平衡点,这本身就是一个悬而未决的技术难题。
打个比方,这就像你雇了个新员工,他要么闷头自己乱猜方案交差,问题出了才发现,要么变成事事都要请示的"复读机式员工",你被烦得没法专心干别的活。真正靠谱的同事,应该是那种知道"这件事我拿不准,得问一下"和"这种小事我自己决定就行"的人,而现在的AI显然还没学会这个分寸感。
为什么这事儿现在特别紧迫:三大近忧
作者花了不少篇幅论证,如果不认真研究人机协作机制,短期内会有哪些实打实的风险。这部分内容信息量很大,值得慢慢展开。
### AI生产的科学知识,到底靠不靠谱?
**幻觉**:LLM一本正经地编造不存在的事实、引用、数据的现象
一份事后审查发现,2025年NeurIPS会议上有51篇被接收的论文里,藏着100条被确认是编造出来的引用文献。2026年的ACL会议也查出了一百多篇论文引用了根本不存在的文献。
这不是个例。更普遍的问题是,LLM在面对高难度任务时,很容易直接编造实验数据或结果,这在论文自己做的AstaBench实验里也观察到了。
还有个更隐蔽的风险叫偏见固化。研究发现,GPT-4生成的大学申请文书,整体上比人写的文书更缺乏新意。这事听起来无关痛痒,但放到科研场景里就很吓人了:如果AI总是倾向于重复已有的研究范式,同时低估那些新颖但少见的想法,长此以往,科学探索的多样性就会被悄悄压缩。
论文引用了一项非常关键的研究数据:AI辅助的研究团队产出的论文数量是普通团队的3倍,但探索的话题多样性反而下降了5%。
这个数字值得琢磨一下。产量翻三倍听起来是巨大的效率提升,但代价是科学家们越来越扎堆研究同一批"AI觉得靠谱"的方向,那些边缘的、古怪的、可能孕育突破的冷门思路反而更难被触碰。
### AI会不会把科学界的"基础设施"压垮?
AI科学家的产量爆炸,正在把同行评审系统压到极限。数据显示,NeurIPS和ICLR这两个顶级AI会议的投稿量,从2014年到2024年增长了10.4倍,但审稿人数量根本跟不上这个节奏。
更麻烦的是安全层面的问题。攻击者可以通过投毒像维基百科这样的公共知识库,诱导LLM在生成代码时植入后门。
但作者认为最值得警惕的,其实是"去技能化"问题:过度依赖AI可能会让科学家,尤其是刚入行的年轻研究者,逐渐丧失独立思考和动手的能力。
有研究显示,依赖AI编程助手的开发者,对代码背后概念的理解程度明显下降。而且年轻人对这种"认知外包"的易感性更高。
这就好比长期用导航软件开车的人,会慢慢丧失方向感和路线规划能力。如果一个刚拿到驾照的新手从第一天起就完全依赖导航,等某天手机没电,他大概率会在自己生活了十年的城市里迷路。科研上的"去技能化"是类似的逻辑:如果一个博士生从入学第一天起写代码、推公式、组织论文全靠AI代劳,那些本该在磕磕绊绊中练出来的基本功,可能永远练不出来了。
### 出了问题,谁该负责?
当AI科学家被用来做一些敏感甚至有害的研究时,责任归属是笔糊涂账。美国NIST(国家标准与技术研究院)已经明确指出,AI在增强化学、生物、放射性、核武器能力方面存在特殊风险。
还有个容易被忽视的问题叫无意抄袭:即便AI生成的文字不是逐字照搬,判断这段内容到底算不算"原创"也异常困难。一份专家评审发现,36%的LLM和AI科学家生成的论文里存在明显的抄袭痕迹。
作者的结论是,人类如果能在关键的决策节点上真正介入,或许能帮助厘清这种责任模糊地带,这对科研质量和安全都有好处。
人和AI搭伙,真能产出1+1>2的成果吗?
讲完风险,论文转向了更有建设性的部分:人类和AI协作,到底能不能产生单靠一方都做不到的成果?
作者引入了一个概念叫**人机协同**,这是任何人机系统研究都要追求的终极目标:让人类和AI的组合表现,超过任何一方单独工作的水平。
论文里有个说法很有意思,叫"信息和能力的不对称是有效协作的关键驱动力"。翻译成大白话就是:正因为人和AI擅长的东西不一样,搭档才有意义。如果两者能力完全重叠,那协作反而是浪费。
为了具体说明这一点,论文分析了两个真实的科学家协作案例。
### 案例一:写数学论文时,AI补细节、人补漏洞
前面提到的那位复杂性理论学家用Gemini 3 Pro写论文的故事,就是这个案例的主角。
AI在这个过程中的贡献很实在:把一个"该发表但一直没空整理"的定理,从零散的想法变成结构完整的论文草稿,八轮对话就搞定了初稿框架和不断扩充的证明细节。这大大压缩了整理论文所需要的时间成本。
但人类的贡献是不可替代的:识别出了缺失的技术背景(比如相关的前人工作、一个"搜索vs决策"的理论框架),还纠正了引理里一处错误的假设。
论文对此的评价很中肯:这次合作之所以能成功,是因为这位专家有能力诊断出遗漏之处、给出高质量的反馈。换个没这么厉害的专家,同样的工作流程很可能会失败,或者产出一篇具有误导性的论文。
这里藏着一个值得警惕的隐忧:这种"专家带AI打下手"的协作模式,如果被广泛采用,可能会让科学写作变得千篇一律,而且对早期职业科学家来说风险格外大,因为他们本身还需要通过刻意练习来培养核心的写作和推理能力。
### 案例二:用GPT-5搞热核燃烧的物理建模
第二个案例来自一份关于GPT-5科研能力的早期实验报告。一位专家和GPT-5合作,去建立一个热核燃烧起爆和传播的简化物理模型,整个过程分四步:搭建简化的偏微分方程模型、实现数值模拟、设计数值实验找关键敏感因素、最后提炼出一套理论来解释模拟结果。
这位专家事后总结说,这次协作最大的收获,不是省了多少时间,而是最后那一步,把已知的物理关系整合成一个封闭形式的预测公式,用来验证数值模拟得出的趋势在物理上是不是站得住脚。
AI的贡献在于把一个人类提出的概念,转译成具体的计算工作流:起草偏微分方程表达式、纳入领域内熟悉的物理要素、做离散化处理、搭建优化程序框架。
人类的贡献则集中在数值计算最繁琐的环节:手动调试热点和冷燃料的初始条件、导热系数、阿尔法粒子阻止假设、燃料剖面设计,反复试错才能得到物理上有意义的结果。更关键的是,人类还承担了认知把关的角色,识别出哪些输出其实还只是噪声,抓出被过度简化的地方,拒绝AI悄悄用粗糙近似替代完整数值求解的"偷懒"行为。
这个案例透露出一个和第一个案例呼应的规律:GPT-5表现出了同样的老毛病,就是过早表现出自信,把棘手的问题一带而过,需要专家在旁边时刻盯着。
这就像请了个特别能干但有点浮躁的实习生,他能迅速把你脑子里的想法翻译成一版可以跑起来的代码,效率惊人。但如果没人盯着,他遇到搞不定的细节时,很可能悄悄用一个简化版本蒙混过关,看起来结果差不多,实际上物理意义已经跑偏了。这种"看起来对但其实错"的风险,恰恰是需要人类经验去识别的。
一个衡量协作好坏的简单公式
为了让"人机协同"这个概念不只是停留在描述层面,作者提出了一个简化的决策理论框架。
他们把一个人机团队完成科研任务获得的总效用,拆成两部分:
**协作优势**:团队表现相对于团队里最强单个成员的提升幅度,也就是常说的"1+1>2"的那个"多出来的部分"
**协作劣势**:协作过程本身带来的额外成本,比如沟通协调花费的时间token、人类因此承受的额外认知负荷
总效用等于协作优势减去协作劣势。这个公式虽然简单,但指出了一个明确的优化方向:既要让协作优势最大化,又要让协作成本最小化。
基于这两个案例,作者归纳出了一些让协作优势更容易出现的科研环境特征。任务产出的是主观性强的研究成果,比如论文、定理、新的抽象概念,这种情况下人类专家凭多年经验快速判断质量的能力就特别有价值。任务通常是长周期、开放式、由好奇心驱动的,中间会产生一些看起来和最终目标关系不大的子成果。任务还往往要靠有限的、片段化的信息去推断背后隐藏的结构。
相反,如果一个任务的产出可以被自动验证,或者训练数据非常丰富(比如蛋白质结构预测这类已经被AlphaFold之类系统攻克的领域),协作成本很可能会盖过协作优势,这时候单纯依靠AI自动化反而更划算。
作者还提出了几个悬而未决的开放问题。人机之间的信任该怎么建立和维持,才能提升总效用?过度依赖AI和总效用之间是什么关系,怎么设计交互方式能减少这种依赖风险?让AI参与到实时协作过程中,会不会因为处理延迟这类因素反而增加协作成本?这些问题目前都还没有清晰的答案。
反对的声音:这套框架真的划算吗?
论文也很坦诚地摆出了一种反对意见:就算人机协同这套思路在理论上成立,实际操作起来的评估成本可能高到不值得。
真正严谨地比较"人机团队"和"单独的人"、"单独的AI"哪个更强,需要做**人机对照评估**,这类研究目前普遍昂贵,而且很难复现。
反对者的逻辑是:只有当协作带来的总效用,明显超过单独人类或单独AI能达到的最好水平,并且这个差距大到足以覆盖评估本身的成本,这套框架才有实际意义。
作者对此的回应是采取分阶段评估的策略:先用成本较低的方式摸底,比如问卷调查、针对单项协作能力的小型测试、观察AI日志和统计数据、还有像本文这样的案例研究,等到信号足够强了,再去投入昂贵的正式对照实验。
他们还提出了几个轻量级的代理指标。衡量协作成本可以用"审阅时间",让一个AI裁判去评判智能体提出的问题是不是简洁可操作、生成的研究材料是不是啰嗦拖沓;也可以用"干预密度",衡量AI产出内容和人类最终定稿之间的编辑距离有多大。衡量协作优势则可以用"模拟神谕协同",让一个更强的LLM扮演虚拟的人类科学家角色,自动测试AI智能体消化和应用批判性反馈的能力有多强。
写在后面
读完这篇论文,最让我意外的不是它讲了多少AI的风险,而是那个92次提问却拖累了任务表现的实验数据。
这个细节戳破了一个我原本没想过的假设:我一直以为"让AI多问问题"总归是安全的做法,最坏也就是多花点时间。但数据显示这不成立,强制每步都问反而让端到端得分从0.39跌到0.24,掉了将近四成。
这说明一个道理,好的协作节奏本身就是一种需要被设计、被学习的能力,不是简单地"给足够多的沟通机会"就能自动出现的。这和团队管理里"过度开会反而降低效率"的现象有点像,只是发生在人和AI之间,而且现在没人知道这个平衡点该怎么调。
另外一个让我反复琢磨的地方是两个案例研究里都出现了同一个AI毛病:过早表现出自信,把复杂问题一带而过。这两个案例分别是数学论文写作和核物理建模,领域跨度很大,但AI犯的错误是同一种类型,这可能不是巧合,而是当前这代LLM某种深层的行为模式。如果连热核聚变这么硬核的领域都会被AI的"自信过头"坑一把,那些没有资深专家在旁边盯着的应用场景,会不会已经在悄悄产生一批"看起来严谨实际有硬伤"的成果了?
Q&A
Q1:AI科学家和人机系统有什么区别?
A:AI科学家通常指追求高度自主完成科研全流程的AI系统,研究重点在于AI单独能做多少事。人机系统则把人类和AI看作一个整体,研究单位是"人和AI这一对",重点关注两者如何配合、反馈如何流动,而不是只看AI一方的表现。
Q2:现在的AI科学家系统,人类能在哪些环节介入?
A:论文把介入渠道分成四层:只能在最终成果出来后评审的"产出物层面",能在几个大阶段之间的关卡审查的"发现阶段层面",能在AI动手前参与规划的"研究规划层面",以及能随时打断、随时纠正的"异步引导层面"。目前绝大多数系统都停留在前两层,能做到实时打断的系统很少。
Q3:AI辅助科研会带来哪些实际风险?
A:论文列举了几个已经发生的问题,包括LLM编造引用文献导致多篇会议论文被曝出虚假引用、AI生成内容的多样性低于人类导致研究话题趋同、过度依赖AI编程助手会削弱使用者对代码的概念理解、以及AI生成论文中存在抄袭的比例达到36%左右。