编辑|Panda
前些时日,OpenAI 在 GitHub 上一口气放出了 722 篇数学论文手稿。这些手稿被归为 372 个结果「家族」,横跨 17 个数学领域,全部出自一个尚未发布、也没有公开名字的内部模型——其性能远胜 GPT-6 Astra。
OpenAI 首席研究官 Mark Chen 的推文
(资料图片)
当然,数学界对这批成果的质量和披露方式仍有不少争议,但有一点已经很难否认:AI 产出研究成果的速度,开始以「百篇」为单位计算了。
几乎在同一时间,最新一期 The Information Bottleneck 播客里,一位深度学习老兵说出了一句让不少研究者心头一紧的话:「做完这个项目,拿到一些挺有意思的结果之后,我突然意识到:哇,我的工作大概五年内就会被取代。」
播客地址:https://www.the-information-bottleneck.com/p/yuandong-tian-on-recursive-self-improvement-600
说这话的是田渊栋。他在 Meta FAIR 待了近十年,做过围棋 AI、强化学习、神经网络可解释性,也是 Coconut(连续潜空间思维链)论文的作者之一。
如今,他的身份是Recursive Superintelligence的联合创始人。今年 5 月,这家公司结束隐身状态,宣布以 46.5 亿美元估值完成超过 6.5 亿美元融资,由 GV 和 Greycroft 领投,英伟达和 AMD 参投。
在 Ravid Shwartz-Ziv 主持这一期播客中,田渊栋解释了自己为什么出来创业:「与其被动地丢掉工作,不如主动去开一家朝这个方向走的公司。」不过,他也在节目里给 AI 泼了点冷水。「如果你让模型自己想点子,它会给你一些非常平庸的想法,基本上谁都知道,也不是什么有意思的方向。」
在将近一小时的对话里,田渊栋从 CMU 时代的 AlexNet 争论讲到围棋 AI,从「动作空间」讲到潜空间推理,最后落到递归自我改进、新架构和开源。以下是这场对话的整理。
Smith Hall 里的争吵:AlexNet 到底是不是个意外?
田渊栋 2008 年来到美国,在卡内基梅隆大学机器人研究所读博。那时,机器学习远没有今天的地位。「当时很多人其实不认为机器学习是一条靠谱的路,大家会说它不太行,因为会过拟合,也搞不清楚里面发生了什么。」
他的博士课题是计算机视觉里的非凸优化问题,比如还原水面折射造成的图像畸变。他用一种分层的方法去优化,并证明了即便问题非凸,只要数据足够多,仍然可以在一定程度上证明最优性。「数据驱动加上优化,这个组合挺有意思的,我到现在都还挺为这份工作骄傲。」
2012 年 AlexNet 横空出世。田渊栋给 Alex Krizhevsky 发了封邮件,要来代码自己摆弄了一番。他很快意识到,卷积网络的层级化处理,和自己论文里的分层优化思路其实是一回事,「可能是我一直在追求的东西,只是换了一种形式」。
但当时 CMU 的气氛并不友好。「大家每天来办公室,在 Smith Hall 里激烈争论 AlexNet 的结果到底是侥幸还是真正的突破。大多数人都说只是侥幸,因为这不合常理。」
2013 年毕业时,田渊栋拿到了几家想做深度学习的机构的 offer,最终却选择了 Google 自动驾驶团队,一方面是名气,一方面是朋友内推。可在那里的一年零三个月里,他并没能做成深度学习,因为团队更像创业公司,需要用成熟方案解决实际问题,而不是做科学探索。于是他跳槽去了 FAIR,并称这是「当时做过的最好的选择之一」。
两个人、一块 GPU:田渊栋的围棋往事
在 FAIR,田渊栋启动的第一个项目是围棋 AI。2015 年,他的团队做出了DarkForest,靠卷积网络在网上击败了顶尖业余棋手。几个月后,AlphaGo 在 2016 年春天击败了职业棋手。
面对这样的「撞车」,田渊栋的复盘认为 AlphaGo 有两点自己没有的:
- 价值网络,DarkForest 当时只有策略网络;
- 他本人此前几乎没有强化学习背景,「基本是边做边学,就像对自己做强化学习」。这段经历让他之后转向了大量强化学习研究。
被问到 AlphaGo 是否令人意外,他的回答很有意思:方法本身并不惊人,因为卷积网络能捕捉到人类下棋时依赖的棋盘模式,「真正让人惊讶的是,它居然能打败职业棋手」。
2018 年,团队复现了 AlphaZero,即完全不依赖人类棋谱、从零自我对弈的方案,并做了一些效率改进,得到了OpenGo。这个 AI 在与韩国棋院的正式对局中,只用一块 V100 GPU,就让四位职业棋手一盘未胜。「我想那大概是第一次有人用单块 GPU 战胜职业棋手。」
比赛前还有个小插曲。团队请职业和半职业棋手朋友评估 OpenGo 的棋力,结果对方表示,开局还看得懂,之后就完全看不明白了,只能说「看起来很强,但我也不知道是不是真的强」。于是田渊栋决定:那就直接找真正的职业棋手下一场。
动作空间比算法更重要
谈到那个时代的强化学习,田渊栋认为有不少方法至今仍被低估。比如分布式强化学习,用奖励的分布而非单个标量来调整模型;又比如Q-learning 等不同的建模方式。「但现在我们大多数时候用的都是策略梯度,这是很不一样的时代。」
他同样看好无梯度优化方法,而且认为大模型给了它们新的可能性:「大模型现在对系统、对要优化的目标函数有更好的高层理解,这种高层理解比局部梯度信息要有用得多。」在梯度起伏剧烈、局部最优随处可见的情况下,梯度可能会把人带进死胡同,而无梯度方法天然包含探索,「这是梯度方法从来不会做的事」。
2018、2019 年前后,田渊栋开始尝试把强化学习用在真实世界的问题上,结论颇为出人意料:「真正重要的不是算法,而是动作空间和状态空间的设计。」
他以神经架构搜索为例。人类知道网络深度很关键,但 AI 不知道。如果 AI 一开始去搜索第一层卷积核大小这样的细节,所有分支的表现都差不多,价值函数给不出有用信号,只能逐层深入,搜索空间就会指数爆炸,「这时你用什么算法都没用」。反过来,如果能把动作空间重新组织,让 AI 先「意识到」深度很重要,深网络和浅网络之间就会出现鲜明对比,几次 rollout 就能看出方向。团队据此提出了潜空间蒙特卡洛树搜索(LA-MCTS),核心思想就是自动找到能让搜索子空间区分度最高的动作空间。
Coconut:「我思考的时候从来不用语言」
联合主持人提到了田渊栋参与的Coconut论文,即让模型在连续潜空间而非 token 空间中推理。田渊栋说,这个想法源于他对自己的观察:「我思考的时候从来不用语言。我能清楚地感觉到,思考时用的是大脑的另一个部分,然后必须把想法翻译成语言,才能和别人顺畅交流。」
从这个直觉出发,团队做了理论推导,发现潜在表示可以是多种想法的叠加态,用它来推理,在图遍历之类的问题上可能获得显著优势,「也许不是指数级的,但至少有一定优势」。
那为什么前沿模型至今没有采用连续思维链?田渊栋给了两个原因。
- 数据:人类大量的思考过程以语言形式被记录下来,潜空间则没有这样的数据。
- 潜在表示可能是高度个人化的,「每个人多少都在用自己的潜在表示」,而大模型的学习效率远低于人类,只能先用语言作为替代。
Ravid Shwartz-Ziv 追问,这是否和 JEPA 等自监督方法面临的正则化难题类似。田渊栋表示认同,并把问题推得更深:梯度下降可能本身就陷入了一种「元层面的局部最优」,有些很好的表示,现在的训练范式也许根本学不到,「我们现在并不知道边界在哪」。
在他看来,这正是可解释性研究的意义所在,「就像炼金术和化学的区别」。只不过当下模型太强,所有人都在追结果,愿意投身这个方向的人和时间都还不够。
和 GPT-5 合写最后一篇论文之后
说到大模型时代的转型,田渊栋认为,自己从 2018 年起持续在做的神经网络训练动力学分析,换到大模型上方法依然相通,并没有带来断裂。真正的冲击在实证层面:研究者过去自己提假设、做实验、得结论,这一流程和一两百年前没什么本质区别;而当模型越来越强,自己就能产出想法,「研究者可能被迫在元层面思考,而不是把时间花在提出一个个具体假设上」。
同时,工程能力的地位大幅抬升。大模型时代的许多好工作「一半是研究,一半是工程」。直到 AI 编程智能体出现,局面又发生了变化:有扎实经验的研究者可以让智能体快速实现想法、定位关键问题,「突然之间就拥有了超能力,可以去探索真正深层的东西」。
转折点是他在 Meta 的最后一篇论文——他也是唯一作者。这篇论文研究的是神经网络的grokking现象,即网络先死记硬背、训练到某一时刻突然学会泛化。
整个过程中,他把 GPT-5 当作合作者:问它问题,给它「布置作业」,让它证明定理、检查定理是否成立、一起头脑风暴。
结果是效率提升了大约 6 到 10 倍,「而且这还是保守估计,因为当时我还在自己写代码」。如今代码和实现也可以交给强大的智能体,速度只会更快。
于是有了开头那句话。田渊栋坦言,研究者通常不愿去小公司当联合创始人,因为要操心大量研究之外的事情,「但我觉得现在是一次相变,如果我什么都不做,以后可能就无关紧要了」。
联合主持人半开玩笑地回应,自己的应对方式是去学动手干活,可惜「我并不擅长动手」。
AI 还想不出好点子
不过,田渊栋并不认为人类已经可以退场。「我不觉得现在的模型能在没有任何人类干预的情况下给出很好的结果。」即便是那篇和 GPT-5 合写的论文,高层思路也是他给的,而不是让模型自己想。
人类目前仍然要负责:
- 发起,决定什么问题值得做
- 验证,判断 AI 给出的方案靠不靠谱
Ravid Shwartz-Ziv 提到,近期不少让智能体自主做后训练、刷 Kaggle 的工作,都暴露出想法空间狭窄、容易对指标过拟合的问题。田渊栋认为,这在一定程度上是暂时的:模型被要求处理细节却缺乏上下文,给它更多背景,它就可能提出比调超参数更有意思的想法。
但他也承认,补上下文只是「临时修补」。现在的模型擅长重复性工作,因为互联网数据里充满了这类内容;如果要模型真正跳出框框,就需要新的架构,让它能用极少的数据快速捕捉新信号。「从常规的重复性工作走到下一个层级,我们需要一次大的跃迁。」
在「提出想法、写代码、跑实验、分析结果」这个研究闭环里,他认为最难自动化的是想法。当被问到Recursive 在 NanoGPT Speedrun 上的成绩,即把训练时间从 79.7 秒压到 77.5 秒,究竟是真正的发现,还是对已知技巧的高效搜索时,田渊栋的回答是「两者兼有」。比如在注意力里加入 bigram 信息的做法,可以在 DeepSeek、Gemma 3 乃至他在 Meta 时参与的 STEM 论文中找到相近思路,但如何在不同层使用不同的嵌入表、把这些想法组合起来,又包含了新的创造性。
新架构为何总在规模化时「失灵」?
不少公司提出过 Transformer 的替代架构,在小规模实验上表现亮眼,却始终没能扩展到大模型。田渊栋的解释是归纳偏置:小规模时数据不足,必须引入额外的结构假设,效果自然好;数据一多,最好的做法反而是让模型自己去找规律。他举了 ViT 的例子:ImageNet 量级的数据上,ViT 不如卷积网络,但数据量到了数亿级别,Transformer 就反超了。
那么,新架构该怎么验证?
田渊栋认为当然要从小规模开始,但关键在于理解网络内部到底发生了什么,「我们需要知道其中有某种洞见是能扩展到更大规模的,这样才有信心」。否则,如果只是盲目遵循 scaling law,就永远无法证明小规模上有效的东西在大规模上也有效,「那唯一的结果就是,算力最多的公司赢」。
他心目中更长远的目标,是找到与人类相当的学习效率。人脑只用二三十瓦功耗和极少的数据,就能在很短时间内理解事物。机器人领域今天强调需要海量数据,在他看来只是当前范式的要求,「看看猫、狗这些具身的生物,它们并不需要那么多数据,处理器也很粗糙,却能在复杂世界里生存,那里面一定有新的算法」。而强化学习和自我改进,可能是通往那里最快的路。
限制自我改进?「边界太模糊了」
节目最后,主持人问到了当下 AI 安全领域的一个热点:有人呼吁限制最新模型,并就递归自我改进进行行业协调。
田渊栋的回答很直接:「说实话,我觉得很难阻止人们这么做。」在他看来,边界本身就模糊不清:你和编程智能体讨论新想法、让它迭代,某种程度上就是自我改进;你和别人合作写论文,也是自我改进。再加上越来越强的开源模型,用它们做研究算不算自我改进?又该如何监管?
他明确表示,Recursive 会开源研究成果。此前公司的博客文章就开源了全部内核和训练方案,让外界可以检验、在此基础上继续开发。他更担心另一种局面:「最糟糕的情况是,一小撮精英掌控着世界上最强的模型,然后让其他所有人支付高昂溢价来使用。」
对于开源模型能否追上闭源,他相当乐观。他以 Kimi 为例,认为它已经很好用,只是思考过程可能略长。在他看来,编程智能体并不需要「AI 牛顿」、「AI 爱因斯坦」上门帮你写代码,只要模型越过某条可用的线就够了。
前沿实验室早已越线,开源模型也正在越线,「一旦越过,它就会被商品化,每个人都会用自己喜欢的模型」。
从 Smith Hall 里那场关于 AlexNet 是否「侥幸」的争论算起,已经过去了十四年。当年被质疑的深度学习,如今已经开始自己写论文、改代码、刷记录。田渊栋选择站到这股浪潮的最前面,用他的话说,接下来真正的问题是:「我们如何利用所有这些模型,去做更好、更大的事情。」
-
杜兰特谈中国赛:我渴望上场打球 请求教练让我出战下半场|滚动
-
田渊栋:与GPT-5合写最后一篇论文后,我意识到自己5年内会失业
-
每日速读!10日央视直播!中央5套CCTV5、CCTV5+直播节目表:郑钦文冲击冠军,U18女篮争夺季军
-
奇瑞汽车旗下合肥智能科技公司增资至1.68亿 增幅1580% 焦点播报
-
每日动态!14球3助攻却落选金球奖名单,他又伤了
-
今日聚焦!四大AI预测利雅得新月vs吉达联合:四家一致看好新月主场取胜
-
天宽科技中标南网 “驭电” 大模型开发支持研究项目|焦点速读
-
“绿电高速公路”要来了!烟威1000千伏特高压工程竣工投产-每日热议
-
第35届“飞天奖”揭晓,王仁君、宋佳获优秀男女演员奖|热点聚焦
-
上海洗霸投资成立新能源科技公司 含电池制造业务|焦点热闻
-
金山原创剧亮相“长三角地区2026年世界安宁缓和医疗日主题活动”案例展演
-
焦点信息:湘中一脉共风骨 风景这边独好——写在10月11日湘超娄底VS邵阳湘中兄弟德比之际
-
华创云信补缴税款滞纳金6191.75万!占上半年净利26%,不涉及行政处罚-今日精选
-
最高资助35万元!河南这些项目拟入选
-
5投0中,广东队外援去OR留?|每日快播
-
生态环境法典知识竞答|每周一答,周周赢好礼,第四期来啦!_焦点快播
-
石首市九农包装制品厂(个体工商户)成立 注册资本50万人民币
-
Stifel点名五大AI半导体股,数据中心基本面持续走强 最新
-
快讯:恒顺醋业(600305.SH)新注册《恒字印商标》美术作品的著作权
-
新余市恒磁再生资源有限公司成立 注册资本200万人民币
-
瑞芯微:融资净买入3744.84万元,融资余额15.06亿元 热消息
-
观天下!热刺英超客场25次输曼联,输球场次仅少于埃弗顿客场对阿森纳
-
关机翻译成close the phone?老外根本听不懂!-速读
-
看点:4年2.77亿要价对4年2亿报价,尼克斯暂停全部续约谈判
-
F1新加坡冲刺排位赛:维斯塔潘夺杆,拉塞尔第2,乐扣第3 观速讯
-
速看:10月9日增减持汇总:富特科技等3股拟减持,当日暂无A股上市公司拟增持(表)
-
每日速读!斩获五连板!时代万恒提示风险称公司产品未涉及固态电池
-
纽约主场首秀 德拉蒙德:感觉有点不真实 我从小是尼克斯球迷|实时
-
【聚看点】岚图汽车卢放谈汽车安全,称真正重要的是车辆设计所秉持的安全理念、底线与原则
-
焦点快报!高伟电子(01415)10月9日斥资约555.12万港元回购26万股
-
生意社聚合氯化铝10月9日均差为3.01元/吨 由正向扩大转为缩小-前沿资讯
-
普华和顺(01358.HK)发布公告,于2026年10月9日斥资91万港元回购100万股
-
WhatsApp多账号管理不只是多开 傲途销售个号矩阵的差异化
-
福昕软件:10月8日召开业绩说明会,投资者参与-微速讯
-
基本半导体(09971.HK)10月9日耗资95.75万港元回购2.44万股-微头条
-
【报资讯】清科控股(01945)10月9日斥资2164港元回购1600股
-
英镑兑日元升破209关口,英央行加息预期与日元疲软共推涨势 焦点热讯
-
每日关注!8月中国汽车整车进口量同比下降50.1% 出口量同比增长37.2%
-
华兰生物:截至2026年9月30日,公司共有14万余名投资者-当前焦点
-
即时焦点:佛燃能源:三水水都分布式能源站项目正在建设中
-
每日讯息!大全能源:多晶硅实际产量变化是影响行业基本面的核心变量
-
大全能源:已围绕新型储能装备、固态变压器进行研发项目立项
-
10月京沪深宅地“缺席” 土拍释放什么信号?_焦点信息
-
光通信龙头Lumentum称公司光学元件订单已排满至2029年初 每日关注
-
港股异动 | 大金重工(01081)高位急跌 午后跌幅扩大超13% 公司A股跌停 每日观察
-
四川振兴投资、上海科创集团等成立东西部协同创新创投基金
-
百胜中国(09987.HK)涨超4%,截至发稿,涨4.14%,报337.2港元,成交额8770.11万港元 当前热议
-
PriceSeek提醒:巴基斯坦26/27年度皮棉上市量同比增5.4%-今热点
-
紫竹高科连收4个涨停板-每日简讯
-
动态:电池板块再度拉升 天赐材料涨停
-
惠州市美高机械科技有限公司成立 注册资本100万人民币
-
广水市艳阳复合材料商行(个体工商户)成立 注册资本1万人民币-快播
-
申万宏源将于12月31日派发中期股息每10股0.5元
-
一年身价暴涨数倍,曼城新核心已跻身欧洲亿元球星行列,瓜帅眼光真准
-
刚刚,GPT-6.1 Sol极速版上线!
-
嘉文世纪投资公司接获联交所额外复牌指引
-
陕西煤业:融资净买入5731.32万元,融资余额5.85亿元
-
德天空:拜仁与JJ-加布里埃尔团队会谈,但目前仍未报价
-
向余望:铜牌也属于铜梁龙的每一个人;全力打好最后4轮联赛
-
记者:小蜘蛛与经纪人伊达尔戈合作,马竞内部积极看待此事
-
高盛上调Palantir评级至“买入”
-
塑料管道头部企业300599,拟不超6.4亿元切入半导体封装材料赛道,标的公司股东包括比亚迪等
-
海川智能(300720.SZ):郑锦康拟减持不超过3%股份
-
小米澎程,大消息!首销月锁单超7万台
-
上美股份(02145.HK)10月8日耗资156.6万港元回购7.39万股
-
中钢协:9月下旬钢材社会库存环比下降1.9%
-
上海洗霸:公司固态电池相关业务暂未形成长期稳定的规模化收入
-
国联民生:触发控股股东增持公司股份承诺
-
善水科技:连续6个交易日收盘价涨幅偏离值累超100%
-
天洋新材:9月29日董事李铁山减持股份合计30万股
-
小米澎程系列上市单月锁单破7万辆
-
周黑鸭:10月8日斥资22.02万港元回购20.7万股
-
新就业形态劳动者权益保障办法公开征求意见
-
格林达(603931.SH):暂未实施股份回购
-
险资前三季度举牌仅8次 数量退潮背后权益布局热情未减
-
看北京|首都的秋:银杏树黄了
-
第五中锋,尴尬!杨瀚森+饮水机!……
-
孙颖莎爆冷出局,原因曝光!对手说出大实话,邓亚萍点评一针见血
-
PriceSeek提醒:国内1-9月钢厂产能置换商品影响分析
-
方舟逆势加仓 CoreWeave(CRWV.US),减持 Robinhood(HOOD.US)
-
10月8日网络游戏板块跌幅达2%
-
赛力斯入股华晨宝马奔驰中国合资公司
-
国庆假期七天,铁路发送旅客超1.52亿人次
-
国中水务董事及高管增持188.70万元,实控人将继续履行增持计划
-
港股异动 | 希音-W(00625)涨超9% Q4销售旺季预计带动订单量大幅提升 高盛给予目标价62港元
-
国庆假期全国消费市场总体平稳 流动中国动力足
-
美股收跌!芯片股跳水,美光科技逆势涨超4%
-
太美医疗科技(02576)10月7日斥资9.5万港元回购2万股
-
谷歌3.59GW核电大单落地 高盛维持Constellation Energy(CEG.US)“中性”目标价305美元
-
途虎-W(09690.HK)10月7日耗资149.3万港元回购12.62万股
-
英达小儿子谈与巴图关系,依旧没任何联系,对宋丹丹称呼很尊敬
-
趁天抢收保归仓——永城多点发力确保秋收有序推进
-
当前热议!一代人有一代人的“西游记”
-
前沿资讯!秋冬调补,服用膏方有讲究
-
矢志不渝 赛场逐光 今日播报
-
光大期货20260930热点追踪:国庆假期,外盘要盯这3件事_每日消息
-
虹口化妆品备案培训基地启用!为企业合规备案提供专业指导_今日关注
-
人员划转后资产跟进!吉利系智驾整合持续落地:千里科技子公司拟收购极氪智驾研发资产 焦点日报
-
今热点:比亚迪王传福谈对年轻人的建议
-
机场“鹰眼”龚圣: 将预警响应压缩至秒级
24小时热点