AI4AI:让AI成为自己的科学家

作者:Rhyme

AI能力持续提升,但目前来看研发环节仍受人的带宽限制:架构需要人设计,数据配比由人决定,训练方法也依赖研究人员反复试验。算力和数据可以扩展,顶尖研究者的时间却很难复制。AI4AI试图解决的,正是这一约束:让AI参与AI系统本身的研究与开发。因此,AI4AI(AI for AI)与一般的“AI+行业”应用有所不同。其他应用主要优化特定行业的成本和效率,AI-4-AI直接作用于AI研发本身,产出也会反过来提升AI能力。由于研究对象天然数字化、反馈相对标准化,它可能是AI Scientist各垂直方向中较早实现自动化的一类。AI4AI的价值不止于工具提效,更在于改变科研组织方式。当实验空间可以由系统大规模搜索、失败经验可以结构化积累,创新就不必完全依赖少数研究者的直觉,而有机会形成可持续、可扩展的研发流程。

一、概念与边界:AI如何参与AI研发

AI4AI可视为AI Scientist的一个垂直方向。AI Scientist主要解决科学发现自动化问题,即由AI替代或增强科研人员,参与生物、化学、材料、物理、AI等领域的研究工作。AI Scientist for AI是其中一个垂直方向,并具备四项较有利的落地条件:1)研究对象天然数字化,实验可以由代码执行;2)反馈更加标准化;3)研究人员和开发者本身就是用户;4)过程轨迹数据相对容易获取。因此,它可能成为AI Scientist中较早落地的方向。具体而言,AI4AI是利用AI自动化AI系统自身的研究、开发和优化,覆盖模型架构设计、数据构造与筛选、训练配方搜索、超参数优化、推理效率优化和Agent架构改进等环节。AI4AI的关键,是让AI从研发对象转变为研发参与者,并逐步承担部分流程。长期目标是实现AI研发自动化:AI能够持续改进下一代系统,形成模型优化与训练的闭环,并实现持续自我演进。这不仅包括辅助研究员写代码、检索论文,还包括持续运行以下研究流程:

图1|AI4AI将研究过程组织为可持续迭代的闭环。从整体流程看,主要包括提出idea、进行verify和模型训练自动化三部分。Innovator/提出idea:包括目标定义、研究现状建模和假设生成。
  • 研究目标定义:将模糊目标转化为可执行任务,例如在固定算力下提高模型的数学能力,或将某个模型的推理成本降低30%。难点在于,研究目标往往不是单一指标优化,而要在性能、成本、鲁棒性、安全性和工程复杂度之间权衡。
  • 知识获取和研究现状建模:检索论文、代码库、实验记录、内部文档和失败经验,形成对现有研究空间的理解。这一环节的标准化程度较高,评价方式也相对明确。
  • 假设生成:生成多个候选研究方向并排序。这是当前AI4AI难度最高、也最影响能力上限的环节。

Verifier/实验验证:包括实验设计、实验执行、结果分析与反思。

  • 实验设计:将假设转化为实验计划,明确对照组、数据集、模型结构、训练预算、超参数、评价指标、消融实验、中止条件和结果判断规则等。
  • 实验执行:修改训练代码,搭建数据处理流程,配置训练任务,编写评估脚本,构建消融实验并修复运行错误,再交由代码执行环境、算力平台或仿真系统执行。
  • 结果分析与反思:检查统计显著性、实现错误和可复现性,并据此决定扩大实验、小幅修改、更换假设或放弃当前方向。

模型训练自动化:

  • AI4AI的产物可以是论文、新算法、训练配方或数据集,也可以直接交付一个训练完成、性能更好的模型。
  • 从一篇论文或经过验证的idea到训练完成的模型,既可以由人完成,也可以由AI自动执行。相较于提出研究假设,这一流程更为标准化。
图2|从提出假设、实验验证到模型训练的三段自动化。

二、核心价值:重构AI科研的生产函数

问题一:研究人员及其时间是稀缺资源顶尖AI研究员数量有限,大量时间又被文献搜集、环境配置、代码修改、错误排查、消融实验、数据整理、报告撰写和重复验证占用。AI4AI首先可以减少这些执行工作,让研究人员把更多精力放在问题定义、关键判断和结果解释上。问题二:实验空间远大于人类可探索空间模型架构、数据配比、训练参数和后训练策略之间存在巨大的组合空间。研究人员通常依赖经验,只能探索少量候选方向。AI可以通过大规模并行搜索、贝叶斯优化、进化搜索或多智能体协作,覆盖更多组合。问题三:大量失败经验没有被有效积累企业内部积累了大量未发表、未结构化的失败实验。人员流动后,部分经验随之流失,新加入的研究员可能重复相同错误。AI4AI系统可以将这些实验记录转化为结构化记忆。问题四:研究过程难以规模化管理传统研发管理高度依赖研究负责人和少数资深专家。项目增多后,组织很难持续判断哪些项目值得继续、哪些结果可信、哪些团队在重复劳动,以及资源配置是否有效。AI可以帮助统一记录和管理研究目标、实验过程、证据与决策。总体而言,其核心价值是提高科研生产率,并直接作用于AI与科学进步的生产函数。一方面,它可以通过更高的时间利用率和并行计算提高实验效率;另一方面,它有望结合大规模搜索、AI拟合和可解释性方法,提高优质idea出现和被验证的概率。

三、技术路径:从Agent Harness到原生科研模型

四类技术路线分别对应不同的能力来源、落地场景与竞争壁垒。四类路线并不互斥,成熟的AI4AI系统可能采用分层组合:预训练模型提供基础能力,后训练(Post-train)形成领域专长,智能体编排框架(Agent Harness)连接工具和实验环境,专有元模型负责研究规划和持续迭代。从当前产业成熟度看:

  • Agent Harness最容易落地,也是多数创业公司的起点,但独立壁垒相对有限。
  • Post-train更容易形成垂直数据壁垒,在效果与资源投入之间相对均衡。
  • Pre-train的能力上限最高,但更适合资金和算力充足的大型公司。
  • 专有元模型具有较高的长期价值,其壁垒主要来自跨实验积累的长期数据、评价体系和研究决策能力。

四、产业判断:切入环节、商业模式与竞争壁垒

切入环节:长期看,提出假设比实验验证更难,也更关键idea生成是当前AI4AI难度最高的环节。基于现有LLM,生成70-80分的idea相对容易,但要生成95分以上的idea,难度仍然较大。idea生成也决定了系统的能力上限。verifier更偏向执行,而高质量idea过去高度依赖顶尖researchers,即使对他们而言也带有一定随机性。如果AI能够突破idea生成的门槛,就意味着科研taste可以在更大范围内被学习和复制。商业模式:端到端模型优于阶段性发现或服务阶段性发现和服务能够产生一定商业价值,也适合用于验证能力和开展PR,但其价值链较短。下游客户如大模型厂商相对集中,议价能力较强,因此这类业务未必是最优的长期商业模式。通用模型可以满足各垂直领域60-70%的需求,但剩余30-40%仍需结合具体领域的业务语境与专业知识优化。如果AI能够针对某个垂直领域找到更合适的模型架构、数据和训练方式,并完成端到端训练与交付,以优于通用模型的冷启动效果进入场景,再根据真实使用持续迭代,其商业空间会更大,也能形成相对基础模型厂商的差异化。壁垒:创业公司的机会在于速度、专业能力和数据飞轮AI4AI也是基础模型厂商和大型科技公司的重点方向,各家公司都在开展探索。目前各家,尤其是国内企业,投入资源仍然有限,创业公司尚有时间窗口;但从长期看,这一方向会进入主流竞争。先发优势能否转化为壁垒,取决于企业能否建立数据飞轮。AI4AI的持续学习机制为此提供了基础,但仍需尽快形成“更多真实任务→更多实验和失败数据→更好的决策策略→更高成功率→获得更多任务”的业务闭环。

图3|真实任务与失败数据如何沉淀为决策能力。沿着LLM主线进行方法创新,短期投入回报较高,但竞争也更激烈。基础模型厂商拥有底层模型、AI训练数据和可复用的基础设施能力,对创业公司的执行速度和资源投入提出了更高要求。与LLM正交的技术路线,如专有元模型,差异化更强,也可以在一定程度上避开正面竞争。

结语

AI4AI的长期目标并非只为研究员节省时间,而是提高优质研究假设出现和被验证的概率。研究判断力往往沉淀在研究者的经验中;能否率先将其显式化并转化为可训练能力,是决定谁能掌握闭环关键环节的核心。在此之前,竞争重点仍在工程能力:通过Agent Harness积累过程轨迹,通过数据沉淀专业能力,再利用持续反馈提高决策质量。更能反映系统能力的,不只是产品收入,还包括单位算力能够产出多少经过验证的有效假设。随着执行、验证乃至研究方向选择逐步自动化,人类研究者与AI之间的分工也需要重新界定。