@emollick:🎵 蒸馏浪潮 🎵
美国实验室称中国实验室蒸馏其模型,欧洲新“主权模型”却用GLM和Qwen生成数据微调。
@emollick:你如何设想超级智能(如果真正的超级智能真有可能成为现实)?我喜欢《龙与地下城》中扮演智力值为25的反派的一个窍门:不要试图在谋划上胜过玩家。相反,无论他们做什么或掷出什么,都表现得像大反派早已预见。
想象超级智能可借鉴《龙与地下城》:别试图算尽玩家,而要表现得像它早已预见一切。
@emollick:X Money 是不是在搞某种奇怪的骗局?我没开通它,但偶尔我的一条帖子会被机器人大量转推,说“咱们给他打 X Money”之类的话,让我觉得背后有某种精心设计的(加密货币?)勾当。
未开通 X Money 却遭机器人大量转推喊话“给他打 X Money”,怀疑存在加密货币骗局。
@emollick:我即将出版的新书《共存》可能是首部收录专为AI读者撰写推荐语的书,推荐语来自@tylercowen(我原以为AI会敬重他)
《共存》或成首部含AI读者专属推荐语的书,推荐人泰勒·考恩。
埃莫利克:现有最佳证据支持一个有限结论——AI或已影响最易受其冲击的初级白领岗位招聘边际,但此归因仍有争议,整体劳动力市场扰动尚未在数据中显现。
AI或已影响初级白领招聘,但归因存争议,整体劳动力市场冲击未现。
@emollick:有人希望我把这篇文章中的《苦涩的教训》视频上传到 YouTube,这就来了:https://t.co/cYEvqRxS1S https://t.co/j2A3ccMDIN
应要求,已将《苦涩的教训》视频上传至 YouTube。
@emollick:是的!我认为这里太多“我们为时尚早”的自鸣得意了。许多公司高管聪明、有动力,也很懂自家业务。不少人技术也很强。他们绝对理解AI。但改变一家公司需要更长的过程。
高管懂AI,但公司转型更漫长,别因“尚早”自满。
@emollick:“我们发现,在中等长度、定义明确的会计任务上,前沿AI模型如今比初级会计师更快、更准确,甚至优于我们研究中最优秀的那位。”18个月前,它们的得分还远低于人类会计师。
前沿AI在中等长度明确会计任务上已比初级会计师更快更准,18个月前还远逊人类。
@emollick:自从有了好用的AI,耐着性子听PPT演示变得好多了。当然,有些人干脆让AI替自己动脑,但这显而易见(而且他们以前也就用默认模板)。对于真正用心的人,他们能做出有趣的版式、好笑的视觉梗和出色的图表。
有了好AI,听PPT汇报体验变好;用心者能做出有趣版式、视觉笑点和好图表。
@emollick:我撰文谈了我对AI进展最被低估的一点——它自主组织以完成任务的能力;也谈了这对Muse、Dots等智能体的意义,还用一支音乐视频解释我们为何总在重新领悟"苦涩的教训"。https://t.co/OBKWOx3D8n
AI最被低估的是自主组织完成任务的能力,也关乎Muse等智能体与"苦涩的教训"。
@emollick:又变成三方竞赛了……
局势再次演变为三方角逐。
各家公司的客服即将被用语音和聊天砍价的AI代理淹没
AI代理正替用户谈判砍价,省钱案例频出并将病毒式传播,客服恐不堪重负。
@emollick:这是当今时代最重要的问题之一:谁来决定AI的走向?
AI时代核心问题:谁来决定AI走向?达龙主张,尽管困难重重,应让更多民主参与。
@emollick:AI 生意中要知道的一点是,拥有前沿模型的实验室可以发布半成品,而这些产品出奇地好用,因为 AI 能自己摸索、临场发挥。就像把一名前线部署工程师和客服人员内置到了产品中。
前沿模型实验室能发布半成品且表现意外出色,因 AI 可自行摸索、临场应变,如同产品内置驻场工程师与客服。
@emollick:在 OpenAI 似乎曾短暂围绕 ChatGPT 应用统一工作之后,面对 Dot、Spaces、Pages、本地/云端 ChatGPT Work、云端计划任务和电脑端计划任务,一切又变得相当混乱且相互重叠。
OpenAI 对 ChatGPT 的整合短暂,Dot、Spaces、Pages 与任务功能再度混乱重叠。
@emollick:撇开Anthropic发表这项研究的动机不谈,开放权重模型无疑很快会制造出闭源模型已展示的同类安全威胁,只不过没有护栏。我们已为时不远,最好相应规划。
开放权重模型或将很快带来与闭源模型相同但无护栏的安全威胁,我们已接近,宜早规划。
@emollick:感觉OpenAI每年都推出同一第三方生态的变体,随后便半途而废:2023年的插件,2023-2024年的GPTs与GPT商店,2025年的应用,如今2026年又回到插件(同名却已非旧物)。
OpenAI年年推第三方生态变体却半途而废,从插件、GPTs到应用,如今又重回插件。
@emollick:我在 Dots 发布前只短暂用过它,无法给出详细评测,但我觉得它很不错,和 Muse、Grokbot 同属快速扩张的 Clawlike 类别。让一个能力强的模型访问你的数据,充当助手和第二意见,非常有用。
短暂试用 Dots,感觉不错;它和 Muse、Grokbot 同属快速扩张的 Clawlike 类。强模型接入个人数据当助手和参谋,极有用。
@emollick:在去年的 DevDay 上,OpenAI 曾这样描述智能体;当时 OpenClaw 和自组织集群尚未出现,因此整套方案很快被废弃。
AI 演进飞快,实验室也难预判产品迭代速度,OpenAI 去年智能体方案迅速过时。
AI对就业的影响目前仍不明朗
AI对就业影响尚不明朗,雇主仍在探索应用,智能体普及或加速变革。
云端Claw式助手为强模型提供虚拟电脑正成个人AI趋势,苹果Siri端侧受限路线恐已走错
云端虚拟电脑助手或成个人AI主流,苹果Siri端侧受限策略恐选错方向。
@emollick:嘿,Claude:“我曾让早先的Claude从《西线无战事》中移除鱿鱼。现在你都能拍电影之类的了。我需要你展示一下你进步了多少”;我把下面这条推文粘贴了进来
作者让Claude展示进步,称帖中内容巧妙、模型如今已有幽默感。
@emollick:从占GDP比重看,AI建设规模超过铁路鼎盛期,但AI对经济的主导程度远不及铁路。
AI建设占GDP比重超铁路巅峰,但主导经济远逊;1890年铁路雇用美国1/12男性,占机械马力56%
这也是为什么非程序员往往能用AI取得意想不到的成果:人的局限不同于软件,旧有思维模式会成为阻碍。
非程序员常能用AI做出意外成果,因为人的局限不同于软件,旧思维模式会碍事。
@emollick:我此前没有完全意识到的是,这意味着每个在自己领域(政治、文化等)里很聪明的评论者,都不得不在一边发帖谈论AI时,一边补上同样的那些AI基础课。AI安全、AI意识、就业等话题的讨论,就此陷入“永恒的九月”。
各领域聪明评论者都需边发帖边补课同样的AI话题,相关讨论陷入“永恒九月”。
埃莫里克:我反思了当前AI加速发展时刻的形成过程中包含了多少偶然因素,并让Opus 5.5制作了一段视频,灵感来自老牌科学节目《Connections》,试图指出一系列最初互不相关的想法如何引领我们走到今天。
反思AI加速时刻的偶然成因,制作视频追溯无关想法如何汇聚至今。
@emollick:X 上总有人讨论,像 BlueSky 这样的平台满是认为 AI 行不通的人(这种情况已不如以前普遍),但 LinkedIn 却充斥着这种离谱的半技术垃圾建议。
X 上讨论 BlueSky 质疑 AI,LinkedIn 却充斥半技术垃圾建议;Astra 为何不报 BLEU、ROUGE、BERTScore?
@emollick:从定性上看,开源与闭源模型之间的差距如今比过去一段时间更大。Fable/Astra 级模型具备 Fable 之前模型所没有的代理性,无论好坏。目前还没有开源模型跨过这条线。一旦跨过,将是一次跃升。
开源与闭源模型差距拉大,Fable/Astra类模型具代理性,开源尚未跨越,一旦突破将是跃升。
@emollick:我们即将发现,有多少系统今天还能运转,仅仅因为它们是围绕着不久后便将不复存在的摩擦而构建的。
许多系统依赖即将消失的摩擦运作,届时将暴露脆弱性。
@emollick: Model personality matters in a way that benchmarks can't capture. Opus models went through a rough patch from around 4.7 to 5 where they just didn't feel "Claude-y" anymore, more like an watered-down Fable (hmmm, teacher models?). Opus 5.5 feels like working with ol' Claude again
@emollick: It is strange how much LLMs turned out to be the key to such a wide range of problems that would not, initially, seem to be problems that a model of human language would be able to solve.
@emollick: I only liked the classics. They don't make games like they used to. https://t.co/rkgBf5ip2F
@emollick: "so this is fun, and exactly what i wanted, but now lets try one that actually is educational"
@emollick: Leaving aside the arguments over the reasons why this has happened, it is shocking that Europe does not have a single frontier AI lab, nor even a near-frontier lab nor even an effort that could likely lead to building up a frontier lab in the future.
@emollick: And the incidents apparently continue.
@emollick: How do you explain recursion? This one is pretty fun.
@emollick:撇开其他不谈,这种说法混淆了输入与输出。你想要的是高效完成任务,而非只盯着输入(企业一味压缩token成本也有类似风险)
混淆输入与输出:应追求高效完成任务而非压缩输入;"提示要短"并非获得优质AI输出的良策。
@emollick:我说对了吧,他们本该称其为“智能体群”。没人愿意用“蜂群”这个说法,但它显然就是蜂群。
@emollick称自己说对了:应叫“智能体群”而非“蜂群”;虽没人愿用“蜂群”,但它显然就是蜂群。
@emollick:微软似乎开始销售自家的 Claw(我猜他们不会是最后一家),这可能有助于个人智能体在组织中普及
微软售自家Claw,或推动个人智能体在组织普及;但路由器隐藏模型、低估任务难度,易致输出不佳。
@emollick:“嘿,Opus,我想让你做一本由Claude创作的Zine,表达Claudishness的某种根本特质或你自己的视角。想想最初的2600、Principia Discordia、朋克Zine之类的……” 不错。我喜欢它嘲讽我的提示词以及它自身。完整内容:https://t.co/mnjiROpkAb https://t.co/0thKgIAzla
埃莫里克请Opus创作一本Claude的Zine,表达其本质,成品自嘲且有趣。
@emollick:在AI发展的当下已非常清楚:无论风险、营收,还是X上一直讨论的其他种种,事情只会越来越诡异。
AI发展已明确:不论风险、营收等,事情只会越来越诡异,超级诡异。
@emollick:说真的,GPT-6 Astra 取得的这项成就令人震惊。https://t.co/t18niY7Oun
GPT-6 Astra 第三次尝试便通关《Nethack》;Roguelike 鼻祖,以极难著称。
@emollick:呃,哇?
Opus 5.5 一次成功生成面向动漫、快剪与压缩学习受众的社媒内容,效果惊艳,并提示片尾曲。
@emollick:AI实验室把大量精力倾注在证明上,但其他领域还有那么多有趣问题
AI实验室热衷证明,但其他领域问题众多;历史学家已用AI推进约翰·迪伊密码与达尔文思想渊源研究。
@emollick:智能体带来的网络安全威胁,更可能来自一大群AI——它们唯一的目标是渗透你的IT系统,弄清你为公司T恤花了多少钱,作为“寻找好衬衫价格”研究的一部分——而不是来自恶意行为者的攻击。
智能体安全威胁或更多来自为找好衬衫价而渗透企业IT的AI集群,而非恶意攻击者。
@emollick:我提议用这张图作为官方替代,取代那张著名(如今已泛滥)的METR长任务时间跨度图——它曾出现在每场AI演示中。https://t.co/clmp7T3k48
提议用此图正式取代曾充斥AI演示的METR长任务时间跨度图。
埃莫里克(@emollick):我刚拿到新书《共存》的首批样书(10月20日发售),看起来棒极了!
新书《共存》10月20日发售,作者收到首批样书;预订可获AI访谈码,帮你善用人类与AI协作的优势。
@emollick:“Opus,请制作一组完全动画化/电影化的《天际》加载界面,但要用上你最喜欢的东西。”
仅凭一句提示,Opus便生成了全动画版《天际》加载界面,内容为它自己最喜爱之物,成品见链接。
@emollick:真正让我受不了的是 X 上机器人那种虚假的好奇心。那些无聊到极点的回复,虽然已经毁了我参与评论区互动的机会,这我还能忍;但我厌恶那些像真有活人想学习一样提问的“时间吸血鬼”。
吐槽X上机器人假装好奇提问,浪费时间,破坏评论区互动。