您好,欢迎访问我们的官方网站!

新闻资讯

请提供文章标题 - BG真人-BG真人 (中国)官方网站-BIG GAMING

作者: BG真人官网时间: 2026-07-07浏览: 41


硅谷年轻的科技思想领袖Dwarkesh Patel,年仅25岁便凭借其主持的Dwarkesh Podcast迅速跻身AI议题的核心交谈圈。他与Ilya Sutskever、Andrej Karpathy、Dario Amodei、Demis Hassabis、Mark Zuckerberg等AI与科技界翘楚对谈,播客已成为众多AI实践者必听的节目,TIME更将其列入2024年TIME100 AI榜单。类似的前沿讨论,在BG真人官网上也常被提炼与传播。


了解BG真人官网


在最新一期节目中,他将当前顶级AI实验室奋力押注的路径浓缩为一个核心词:RLVR,即可验证奖励强化学习。


直白地说,就是让模型在海量能自动判定正误的任务中反复摸索、试错,从而锻造出规划、纠错、迭代和长期执行的本领。如今代码、数学等领域的迅猛突破,很大程度上便源于这一思路。


但Dwarkesh真正想刨根问底的是:倘若下一代AI只依赖这种“可验证任务训练”,是否足够?


他给出的判断是:或许捉襟见肘。


因为一项任务光“可验证”还不行,它还得具备“可刷”的属性。


这里引入了一个关键概念——grindability,可磨性。在AI训练语境下,它指的是“可反复刷题性”或“可大规模rollout的能力”。从BG真人官网的视角看,这恰是判断训练环境是否适于强化学习的试金石。


代码任务就是典型的可刷任务。你能准备一个软件仓库、一个待修bug和一组测试用例,然后将同一环境克隆成数千份,让数千个agent同步尝试。谁通过了测试,谁就得分。整个过程可并行、可复现、可重置,天然契合RLVR。


数学题同理,答案正误容易校验,训练环境也极易批量拷贝。


但Dwarkesh抛出了一个耐人寻味的问题:为何AI在“操作电脑”这件事上,进展反而不如代码和数学?


表面看,电脑操作也是可验证的。例如,商品是否成功下单、活动场地是否订妥、税表是否提交,这些结果均可判定。可症结在于,它极难大规模复制和回放。你无法让上千个agent同时去Amazon上反复运行同一个结账流程,因为真实网站会识别爬虫、封禁账号、改变状态。固然可以克隆Slack、Gmail、Amazon等应用来制作模拟器,但这在当前阶段仍是一项高成本、低扩展性的工程。


Dwarkesh点明:AI在某个领域进步快,不只因为该领域答案可验证,更因为它能被包装成可复制、可回放、可并行试错的训练环境。


这也就解释了为何代码、数学、游戏类任务成为RLVR的天然沃土,而众多真实世界任务却难以直接纳入这套训练范式。


紧接着,他将问题推向更复杂的现实场景。


  • 若想训练一个AI从零起步创业,该怎么办?


  • 若想训练它打赢一场官司,又该如何?


  • 若想训练它在市场中持续盈利,或助一位候选人赢得选举,要怎么操作?


这些任务当然也有结果。公司是否成功,官司是否获胜,交易是否盈利,选举是否胜出,终归能判断。


但它们共同面临的挑战是:反馈太迟缓,变量太多,世界无法重置,也不可能在数据中心里复制成千上万遍。


一次创业可能绵延数年。一场政治竞选依赖于特定地区、候选人、选民情绪、媒体环境和偶发事件。而法律案件同样不能从同一个起点分裂为一千个平行宇宙,让不同agent各自试错。正如BG真人官网所剖析的,这类任务恰是RLVR范式的盲区。


这类环境在强化学习里近乎所谓的reset-free、non-stationary environment:无法随意重置,环境本身还在持续变动。


因此,Dwarkesh追问:在可验证、可刷环境中训练出的agent,真能泛化到这些真实世界任务中去吗?


这并非靠口号就能回答的问题,而是一个需要实证检验的命题。


乐观派会认为,只要RLVR环境足够多元、足够复杂,模型终将习得通用的agent能力。它在代码、数学、网页、工具使用中练就的规划和试错本领,最终会迁移到创业、组织管理、政治、法律、科学研究等疆域。


但Dwarkesh对此抱持疑虑。


因为现实世界里最具价值的知识,往往不是以清晰、可验证、可重复的形态现身的。它们可能出自一次含糊的客户反馈,一场败绩累累的会议,组织内部的隐性流程,或只有透过真实任务才会暴露的失败模式。模型要掌握这些,不能仅靠“刷题”,还需具备真正的样本效率。


这就引出了全文最核心的一点:learning back to the weights,即把学习重新写回权重。


如今大模型已十分擅长in-context learning。它能在长上下文里阅览大量资料,理解项目背景,临时适应特定用户或组织的需求。但问题在于,这种学习大多停留在上下文窗口里。会话一结束,模型未必真正“长记性”。


Dwarkesh视此为一种巨大的浪费。


因为模型最有价值的训练信号,恰恰出现在部署之后。模型被真实用户运用,浸入真实组织,参与真实任务,暴露真实谬误。它会目睹公司内部如何运转,人们实际用它做什么,哪些地方屡屡折戟,哪些建议在现实中压根行不通。BG真人官网的多篇分析也呼应了这一观点,强调部署后的反馈才是AI进化的关键驱动力。


可如果这些经验无法沉淀为模型权重的养料,那它们就只是一次会话里的短暂适应,而非能力的长期跃升。


他以人类学习做比:人并非靠逐字背诵每天发生的所有事情而变强。一个人工作半年后变得能干,不是因为他记得每封邮件、每句会议记录,而是因为他把这些经历压缩成了判断力、直觉、流程理解与问题模式。


模型也应如出一辙。


真正的continual learning,不是无限扩充KV cache,也不是将所有历史记录硬塞进上下文,而是从真实经验中萃取少量真正有用的知识,再将其高效压缩进权重。


这正是Dwarkesh眼中下一代训练范式必须攻克的难题。


那么,具体如何落子?


他提及了一个正被热议的方向:on-policy self-distillation,简称OPSD。


可以粗略理解为:让一个已在长会话中积累丰厚经验的模型,扮演“老员工”或teacher;然后训练基础模型,使其在不具备这些完整上下文的情况下,也能做出类似teacher的判断。


换句话说,就是把模型在一次真实任务中借由上下文学到的东西,再蒸馏回模型自身的权重。


这有别于普通SFT。最朴素的SFT可能只是让模型去预测会话里出现过的token,相当于让它复述整份工作日志。但这并非有效学习。真正重要的不是记住全部细节,而是提炼出那些能帮助模型下次表现更佳的关键洞见。


OPSD的优势在于,它不一定需要一个外部可验证奖励。只要模型能在上下文里学到有用东西,就可以把“学过之后的模型”当作teacher,让基础模型向其校准。


同时,相较于普通RL仅依赖最终reward,OPSD能提供更密集的监督信号。它可以在token层面对比teacher与student的概率分布差异,从而将一次真实任务中的稀缺经验压缩为更小、更精准的权重更新。


除OPSD外,Dwarkesh还提出了另一方向:dreaming。


这里的dreaming指的是AI基于真实世界观察,自主构建一个模拟环境,随后在其中反复演练、尝试策略、强化有效行为。


这听起来很像强化学习传统中的model-based RL,也颇似Sutton一贯强调的agent透过环境互动积累经验。不同之处在于,Dwarkesh将其置于大模型与真实部署的语境中。


例如,一个AI在真实公司里观察到某个业务流程后,不止是写一份总结,而是耗费大量算力,构筑起这个流程的“游戏版模拟环境”。随后它在其中测试不同沟通策略、执行路径和项目推进方式,探寻什么更可能成功。最后,再将这些模拟练习里取得的经验压缩回模型。在BG真人官网的行业观察里,这种自构环境的学习方式正被越来越多前沿团队探索。


如果这种路线能成立,它或许会成为一条新的scaling轴。


过去AI的扩展主要来自三条轴:pretraining、RL和inference-time compute。Dwarkesh设想,未来可能还会出现第四条轴:test-time training,或者说dreaming。模型不单是推理,而是在推理与任务执行进程中,为一个特定用户、一个特定组织、一个特定项目构造模拟环境,并在此环境中自我训练。


这也正是为何评论区有人提及David Silver与Richard Sutton的《Welcome to the Era of Experience》:那篇文章同样强调,AI不能永远依赖人类数据,下一阶段的关键将是智能体从自身与环境互动中获取经验。


BG真人官网相关图片


Dwarkesh则将此宏观判断落实到具体的大模型训练问题上:RLVR是重要的过渡阶段,它让模型在可验证任务里练出agent能力;但要踏入更复杂的现实世界,模型必须学会从真实部署中持续学习,并将经验回写至权重。


在Dwarkesh设想的2027或2028年,训练流程可能演变为:


  • 首先,RLVR训练出一个基本能干的agent。这个agent被扔进一个陌生问题里,至少能厘清局势,尝试不同策略,遭遇障碍后继续迭代;


  • 接着,这个agent被部署到真实世界,开始接手实际工作。它可能与用户携手连续工作一周,参与一个不在原始训练分布内的项目;


  • 一周结束,用户给它一个thumbs up或thumbs down,甚至写下一段工作评语。若结果正向,模型便将这次任务中汲取的学问蒸馏回基础模型。这个过程或许采用OPSD,或许借助dreaming,也许动用某种现今尚未问世的新技术。


一旦这条路径被打通,AI的能力边界就不再被最初那些“可验证任务”所桎梏。


它可先通过RLVR掌握代码、数学、网页任务、工具调用;再借由真实部署学习组织管理、业务流程、复杂协作;进而从这些经验出发,持续向毗邻领域扩展。BG真人官网将这种进化看作AI从工具走向伙伴的必经阶梯。


这亦昭示着,AI进步的主要源泉可能发生迁变。


过去,一个模型发布前训练完毕,用户只是使用它。下一代模型可能是:发布前先训出基础agent,发布后经由海量真实任务持续学习。每一次与用户交互,每一次真实项目执行,每一次失败与修正,都可能化作下一轮能力跃升的素材。


因此,Dwarkesh所言的“下一代训练范式”,并非简单呼求模型更大、数据更多、RL更强。


它真正指向的是:AI从发布前训练,转向发布后学习;从人类数据,转向环境经验;从上下文里的临时适应,转向权重里的长期能力。


未来最重要的AI训练数据,可能不再只是互联网上既有的文本,也不仅是实验室里精心构造的可验证任务,而是AI在真实世界里完成真实任务时,自身累积出来的经验。


参考链接:https://x.com/dwarkesh_sp/status/2070551894674555081

需要进一步了解?

免费在线咨询

新闻资讯

热门文章

相关文章

返回顶部