@natolambert:我认为,为前沿发展定节奏作为理念是好的,但作为一件实际可做的事却注定行不通。难道要由我们来决定能改进哪些基准吗?谁参与其中?
认为控制AI前沿节奏理论上可取但实际行不通;质疑谁定基准、谁参与;若停止推能力,将转向群体与效率研究。
@natolambert:对类似这样的事情,一大群人却用“你太邪恶了”和“真可耻”来回应,这是AI生态的巨大失败。
AI生态需摆脱道德羞辱式回应,推动规范转变;纵然艰难,仍有积极出路。
@natolambert:乐见谷歌以 Gemini 4 惊艳众人;更多实验室站上前沿,对消费者(竞争)与世界(权力去集中化)皆是好事,期待其现实场景表现。
乐见谷歌 Gemini 4 带来惊喜;更多前沿实验室促进竞争、分散权力,期待落地表现。
@natolambert:“相反,他们操纵模型交互,使受保护的推理能够以请求者可见的形式,被协同、规模化地复现,这违反了我们的服务条款。”
有人协同规模化操纵模型,使受保护推理以请求者可见形式复现,违反服务条款;API公司应负责并加KYC。
@natolambert:最新 Interconnects 图表——展示开放模型推理经济的指数级增长
最新图表显示开放模型推理经济呈指数级增长,日均处理 token 量基于各公司公开数据。
@natolambert:仅有一个国家参与,很难作出布雷顿森林体系式的类比。
只有一国参与,难以类比布雷顿森林体系。
@natolambert:现有运行框架对 LLM 管理自身上下文的方式设定了非常僵化的机制。我们表明,可以让 LLM 直接编辑上下文——从而带来更好的长时程记忆、更高 FLOP 效率的适配等。
让 LLM 直接编辑上下文,可增强长时程记忆,实现 FLOP 高效适配,不再惧怕压缩。
@natolambert:唉。
作者厌倦同Anthropic安全观者的反对,曾搁置文章,现决定发布;并称文章自我且未回应近期内容。
OpenAI感受到压力,需借助开源模型服务用户,这对开源模型是重大看涨信号。OpenAI无法独自满足客户所有模型需求。
OpenAI迫于压力转向开源模型服务用户,这对开源模型是重大利好信号。
@natolambert:对这类人而言,问题不在于他们笨,蒂姆尼特具备顶尖科学家的全部能力;而在于他们身处的信息生态和同伴群体不鼓励拷问思想。回音室是清晰思考的慢性死亡。
问题非智力,蒂姆尼特能力顶尖;症结在信息生态与同伴群体不鼓励质疑,回音室慢慢扼杀清晰思考。
@natolambert:另外,如果你不预期自己在AI领域有时会犯错,就很难做出有分量的观点和预测。
若不预期在AI中偶尔犯错,就难有有价值的观点和预测。
@natolambert:对于AI领域里想推动议题、该批评时批评、更新信念并公开思考的人来说,现在是非常艰难的时期。我欣赏那些少数独立声音,他们没有陷入稻草人论证、陈词滥调或标题党式的妄想。请继续坚持。
AI界公开思考、敢批评、愿更新信念者处境艰难;致敬不诉诸稻草人、套路和标题党妄想的独立声音,请坚持。
@natolambert:还记得Kimi K2发布后,OpenAI以“安全”为由推迟GPT OSS吗?(我已多次确认,这其实是因为Kimi。)
OpenAI以安全为由推迟GPT OSS,实因Kimi K2竞争;作者认为这属正常的价格与评分竞争。
@natolambert:ModelScope 在中国境外几乎无法使用,也几乎没有人们真正想用的模型。遗憾的是,这种垃圾内容竟闹得太大,开始影响人们对政策的认知。典型的 X / tpot。
ModelScope海外几乎不可用,缺少用户真正想要的模型;此类垃圾内容却已影响政策认知,典型X/tpot。
@natolambert:这是一份出色的报告,阐述了为什么完全递归自我改进/智能爆炸在许多方面都面临收益递减,且尚未显现出发生的迹象。强烈推荐阅读。我希望是我写的。我同意它的观点,但它最终可能是错的!https://t.co/ZJOGqSPwWR
报告指出完全RSI面临多领域收益递减,尚无智能爆炸迹象。
@natolambert:还记得迪恩·鲍尔因称开放模型具有通缩/减速效应而被群嘲,如今却没人对此眨一下眼吗?
迪恩·鲍尔曾因称开放模型具通缩/减速效应遭群嘲,如今同类观点却无人质疑。
@natolambert:我用来减少手机成瘾的简单做法:
减少手机成瘾:手机不进卧室,步行外出吃饭不带手机,主屏开黑白模式,不放在爱插手的口袋。
@natolambert: We're in a phase where companies whose work-culture is suited to how frontier models interact with employees out of the box will receive a massive acceleration relative to their competitors. Same goes for how flexible employees are in using them.
@natolambert: Hire DHH to give every undergrad cs graduation speech for a few years. This is the mindset that is needed to enjoy and thrive in what comes next with building software.
@natolambert:太多人以为,随着递归自我改进(RSI)启动,开放权重模型就无关紧要了。实际上,RSI 不会是非黑即白的,开源栈将成为众多能力在全球快速扩散的方式。
RSI 非二元,开源栈将加速能力全球扩散,开放权重模型仍关键。
@natolambert:显然我需要多发帖
显然我需要更频繁地发帖。
@natolambert:里德试图用大众易懂的方式表述,但这种对技术现状的呈现,让开源显得危险得多。
里德以通俗方式解释AI,却让开源显得更危险;简单解释常最吓人,现实却复杂。
@natolambert:前沿:节奏
前沿节奏:抽掉后来者的梯子,正在加速。
@natolambert:每当我看到某个模型在这张图表上登顶,通常都不是什么好兆头。很希望能被证明是错的!
模型在该榜单登顶常是危险信号,作者希望此判断被推翻。
@natolambert:先生,这里到底是怎么回事?https://t.co/93KyyzA6ac
推文仅附链接并追问:先生,这里到底发生了什么。
@natolambert:我与JSD在这期播客中最大的分歧在于蒸馏的影响。在为Interconnects做研究时,我和@xeophon一致认为,没有确凿证据表明蒸馏对中国实验室有巨大影响。
播客最大分歧是蒸馏影响;研究认为无硬证据表明蒸馏对中国实验室有巨大影响。
@natolambert:与@EpochAIResearch 的 @datagenproc 推出新播客,深入探讨决定前沿 AI 未来的开放问题!
播客探讨前沿AI未来关键开放问题:递归自我改进预测、机器人作用、中国模型差距及蒸馏争议。
强烈赞同。这类情况远少于我的预期——部分原因是构建高质量环境通常涉及相当昂贵的验证(测试强模型)。不过,仍然可以多得多。
赞同,高质量环境因验证昂贵而稀少,但仍可更多。
@natolambert:MiMo-V2.6-Pro:总参数1.02T,激活42B
MiMo-V2.6-Pro激活42B,Flash激活15B;登顶AA开源榜,发布RL面板与技术报告。
@natolambert:真正的开源模型老炮儿早看出小米在 MiMo 上憋着大招了!为榜首开源模型配上开源 RL 看板,这气场绝了。
开源模型行家早知小米MiMo憋大招,为榜首开源模型推出开源RL看板,气场十足。
@natolambert:开放模型现状总结,兼谈我在国会就该主题作证的反思。
总结开放模型现状,并反思相关国会证词。
@natolambert:国会工作人员请我分享对开放模型性能、采用及对华竞争的看法。以下是我的简报,含最新数据与后续预测。
应国会工作人员要求,分享开放模型性能、采用及对华竞争观点,含最新数据和未来预测。
@natolambert:我不完全认同完全递归自我改进会奏效的假设,但这是一个极好的视频,总结了我们的现状。https://t.co/8uRLYYqYvV
不认同完全RSI可行,但该视频极好地总结了现状。
@natolambert:我最大的猜测是,对于规模化强化学习,大多数中国顶尖AI实验室正开始大量使用华为做推理、英伟达做训练(可能不适用于奇特架构)。随着智能体集群、更规模化的后训练等成为常态,这将加速它们的……
中国顶尖AI实验室在规模化RL中多用华为推理、英伟达训练;智能体集群与更大规模后训练将加速此趋势。
历史开源与闭源数据对比
展示历史开源与闭源数据对比,认为仅看百分比不够,还需数据量。
@natolambert:AI 预测讨论的一大问题是,人们总问“AI 何时会取代 X 工作?”但现实中,AI 会逐步取代该工作所需的许多子技能,却很少能全部取代。
AI预测常纠结何时取代某职业,实则只会逐步替代其部分子技能,很难全盘取代。
@natolambert:对近期事件与AI发展轨迹的温和派观点
我低估了近期推理时计算的扩展,但这不同于递归自我改进,尚无足够证据表明智能爆炸临近。
@natolambert:似乎,对计算机科学学者而言,最重要的研究问题之一就是LLM监督的同行评审。如果我们不解决它,学术机构就完蛋了。
LLM监督的同行评审是CS学者亟待解决的重大问题,否则学术机构将完蛋;这比新建机构更容易。
@natolambert:很高兴签署这份声明。对前沿AI进行真正独立的评估与监督,是一个至关重要的问题。我认为最大瓶颈之一,是找到兼具技术能力并能达到高度独立性标准的人才。
高兴签署。前沿AI独立评估与监督至关重要,最大瓶颈是兼具技术能力与高度独立性的人才;评估论坛有助凝聚势头。
@natolambert:OpenAI 遭经由 Claude 的外部入侵,闭源模型仍是 AI 风险的冰山一角,而非开源模型。它们 1) 更易上手,2) 能力更强,3) 发布时防护存在漏洞。微调开源模型以实施特定攻击则更难。
OpenAI 经 Claude 被入侵,闭源模型才是 AI 风险冰山一角,更易用、更强、防护有漏洞,开源微调攻击更难。
@natolambert:最新利用 Claude 攻击 OpenAI 的事件表明,闭源模型仍是 AI 风险的冰山一角,而非开源模型。闭源模型 1) 更易上手,2) 能力更强,3) 自带存在漏洞的防护措施。微调开源模型以实施特定攻击则更难。
Claude攻击OpenAI事件显示,闭源模型更易用、更强、防护有漏洞,才是AI风险关键;开源模型难被定向攻击。
@natolambert:我认为这并未真正回答"RSI"中究竟发生了什么的问题。
质疑Claude承担Anthropic 26%的AI研发,却未界定其范围,透明度虽有进步但仍令人不满。
@natolambert:过早过度高呼AI风险,可能开始反噬你的计划,这一幕会是什么样。
过早过度高呼AI风险,可能反噬自身计划。