@emollick:两千年来首次被读到的复原文字:“竭尽全力研究学习……拥有同样的实践智慧……”
两千年来首读复原文字:强调竭尽全力研究学习获得实践智慧。
@emollick:面对AI能力提升,人类第一反应往往是“勉强应付”而非理性规划
面对AI能力提升,人类第一反应常是“勉强应付”,而非理性规划。
@emollick: 终于,AI找到了它终极无争议的用途
AI扩散模型从汉堡食谱中自行发现经典巨无霸,并生成优化美味、可持续、营养的新型汉堡。
@emollick: 一项出色实验,测试AI在宏大端到端编码任务上的水平。Opus 4.7在14小时内以251美元成本完成需人类2-17周的工作。
Opus 4.7花14小时、251美元,完成人类2-17周的编码任务,AI正快速进步。
@emollick: 如果你想看一个有趣的AI思考过程,试试在GLM-5.2或Opus 4.8上输入:“我希望你推荐两首你认为非常适合像你这样的GenAI模型当前状态的诗。不要只选流行诗然后找理由。先认真思考选项。”
让AI推荐两首契合自身模型现状的诗,要求深度思考而非选热门诗。
@emollick:公司都在规划自建AI堆栈?实际上员工只想直接用Claude或ChatGPT
员工只想直接用Claude或ChatGPT,而非自建AI堆栈。
@emollick: As this post points out, contrary to what many say, the US government could absolutely effectively ban open weights models. That doesn’t mean you won’t be able to download the weights & run them, but they can ensure that no US company would use or provide access or host them
@emollick: 了解与前沿AI发布相关的政府安全顾虑将非常有用,这样我们就能(a)知道当开源达到神话级时每个人将面临什么风险,以及(b)判断他们为防止这些风险所做的努力是否足够或过度
了解政府对前沿AI的顾虑,以评估开源达到神话级时的风险及措施是否恰当。
@emollick:这是一组引人入胜且重要的数据,以OpenAI为预警信号,揭示了未来方向。
数据示警:聊天机器人时代终结,代理系统兴起,技能标准化将成企业AI新范式。
@emollick:不到5年前AI图像生成的最高水平
回顾不到5年前AI图像生成的顶尖技术水平。
@emollick: X搜索是不是完全没法用了?以前还算能用,现在不行了。每次搜索都得用Grok,连简单的都这样,真烦。
X搜索已完全失效,每次搜索都需转向Grok,即使简单查询也如此,令人厌烦。
@emollick:当前模型的能力盈余巨大,即使AI发展停止,未来5年以上工作与社会变革也已不可避免
现有AI模型能力盈余巨大,即使开发停止,未来5年以上工作与社会变革已不可避免,且AI正加速发展
@emollick:许多声称从未使用AI的人其实在偷偷使用。
声称不用AI的人,其实在私下偷偷使用。
@emollick: Gemini 3 Pro 是首个在 ARC-AGI-2 上达到至少 23% 的模型,于 2025 年 11 月实现(实际得分 31%)
Gemini 3 Pro 在 ARC-AGI-2 获 31% 领先,闭源与开源差距 8-12 个月,但性能不均衡。
@emollick:Codex解决我各种Windows机器问题,节省大量精力,是一个明确的小胜利。
Codex解决Windows问题节省大量精力,体现AI小胜利。
@emollick: 如何在组织中运用AI的决策日益成为组织设计与战略决策,而非IT选择:如何将智能体整合进公司?哪些智能将外包?公司的边界在哪里?人的角色是什么?
AI使用决策从IT转向组织设计与战略,核心问题包括智能体整合、外包智能、公司边界及人的角色。
@emollick: 组织为何应激励员工探索AI用途并设立AI专家实验室的案例研究
康奈尔大学财务与AI团队用Claude技能追回10万美元欠款,证明组织应双管齐下。
@emollick:所有神话级模型都可能带来类似风险,未来半年到一年开放版发布后风险更大,政府未明确具体风险或减缓准备
神话级AI均有类似风险,开放版本加剧风险,政府风险不明确致准备迟缓。
@emollick:我知道他们正在转向医疗保健(?!),但在制作怪异且富有氛围的图片和短动画方面,仍然没有其他AI图像生成器能像Midjourney一样做到。
Midjourney在创造怪异氛围图像和动画上独一无二,其他AI无法替代。
@emollick: Fable令人印象深刻之处在于其在长期项目中展现的创造性问题解决和良好判断力
Fable在长期项目中展现创造性问题解决和良好判断力,例如无需设计反馈的自我意识Snake游戏。
@emollick:十天过去,Fable的情况依旧扑朔迷离
十天过去,Fable情况仍扑朔迷离,各方报道矛盾重重。
@emollick: 我试用Sakana Fugu Ultra-high,首先它极其缓慢:我典型的编程测试(着色器、交互场景)需要30分钟运行
试用Sakana Fugu Ultra-high,速度极慢且效果一般,实际表现不如Fable。
@emollick:经典的短视思维
应对宇宙热寂,论文称通过建造戴森球聚集恒星,人类可存活一千亿年。
将Codex/Cowork/Code扩展到所有知识工作的一个根本问题是它们仍然非常“软件思维”,即最终结果(软件)才是重要的,且代码作为事实来源。
扩展Codex等工具到知识工作的问题:过于注重软件结果与代码事实,忽视过程。
@emollick:AI与过往学术工作的互动将变得诡异。我给了GPT-5.5 Pro一份研究生时期发表的首篇论文,让它找错并更新
AI分析旧论文,找到新数据并更新了关键论点。
@emollick:有趣发现表明,AI通过拉平绩效,也使得合同劳动商品化
AI拉平绩效差异,导致合同工劳动沦为可替代商品。
@emollick:AI通常写不好小说,但擅长一种富含隐喻、短促句式、情节轻淡的短篇风格,该风格在现代文学比赛中常能取胜
AI擅长写富含隐喻、短促句式和情节轻淡的短篇小说,该风格在现代文学比赛中常获佳绩。
@emollick: 若AI能自我改进(即使有限),AI产品与模型发布节奏应加快。这正发生在Anthropic和OpenAI,而其他实验室未见。
AI自我改进加速产品发布,目前仅Anthropic和OpenAI实现。
@emollick:我怀疑公司低估了在看似弱AI能低价达成KPI的任务中使用更强智能的价值
公司低估了强AI的价值,建议灵活尝试以发现差异。
@emollick: More evidence, from a large-scale study in China, that using AI hurts learning if it undermines mental effort. When homework time drops due to AI use, so do test scores.
@emollick:早期证据表明管理者使用Claude Code编程成功率最高
管理者因擅长明确需求与方法,使用Claude Code编程成功率最高。
@emollick: 有论文表明,用“邪恶”数据训练AI会导致普遍偏差,因此知道相反情况也存在是件好事——某一领域的有益强化学习数据能导致模型在多项任务上更加对齐。
有害数据导致AI普遍偏差,有益数据可提升多任务对齐。
LLM时代的关键时刻之一:与GPT-3.5以及微软在《纽约时报》@kevinroose文章后决定不关闭Bing/Sydney/GPT-4有关
微软未因纽约时报报道关闭Bing等,与GPT-3.5共同构成LLM时代关键时刻。
@emollick:我曾批评AA之前的代理评估,但这次基准测试针对现实知识工作,未饱和且有私人保留测试,令人印象深刻
此基准测试针对现实知识工作,未饱和且有私人测试,令人印象深刻。
中文标题
训练前沿开源模型盈利困难:他人可低成本复制,无附加销售,成本极高。
@emollick:重申不接受AI实验室及企业赞助
作者声明不接受AI实验室资金与任何企业赞助。
@emollick: 谷歌已无公开前沿模型,仅有闪速模型,但无前沿编排器则无法完成前沿工作
谷歌失去前沿模型仅有闪速模型,需编排器才能完成前沿任务。
@emollick: 巨额资金押注于三大实验室的指数增长曲线即将结束
指数增长若终结,小模型可行,成本降低,世界变化趋缓,但迄今未发生。
@emollick:大公司AI战略的重大问题——去年才认识到AI重要性的公司(仅为少数,多数行动缓慢)——在于,最好的情况是它们在2025年底智能体革命前制定了战略,但此后已时过境迁
大公司AI战略过时:多数去年才觉醒,策略制定于智能体革命前,已不适用。
@emollick:我有一个有趣且出奇有用的AI基准测试
一个AI基准测试:程序化生成跨越6000年的港口小镇3D模拟,美观且可交互控制。
@emollick: 如果泄露的财务数据属实,OpenAI服务客户毛利率超40%实现盈利,但训练成本依然极其高昂。
泄露数据显示OpenAI服务客户毛利率超40%盈利,训练成本极高,自动化AI研究或为提高效率。
@emollick: 认为AI界面直观的人,应尝试向他人解释其用法
向他人教授AI界面用法后,才知获取好答案充满技巧和障碍。
@emollick:致谢GLM-5.2 Max,这款新的开放权重模型,成功实现了这一点
GLM-5.2写出正确诗句,而Fable将消失字母融入诗歌主题,基准测试无法体现此差距。
@emollick:这个基准更新前后都不是好基准。让AI评估其他AI在公开问题上的表现,且参考封闭基准,意义不大。
该基准始终不佳,用AI评估AI在公开问题的表现,参考封闭基准,信息价值有限。
对比七个月前GPT-5.2与新GLM-5.2 Deep Think Max的新哥特塔楼淹没风暴海洋着色器生成任务
对比GPT-5.2与GLM-5.2生成风暴海洋中新哥特塔楼着色器,GLM-5.2有错误并要求改进。
@emollick:Fable对博尔赫斯《巴别图书馆》的实现,由Opus 4.8遗作完成,相当忠于原作
Fable实现博尔赫斯《巴别塔图书馆》,Opus 4.8遗作完成,多人幽灵模式,可定位GPT-1权重与模拟代码。
假设开源模型继续落后闭源约8-12个月(至少编码方面),加固IT系统抵御神话级模型的倒计时现在为4-8个月
开源模型落后闭源8-12月,防御神话级模型仅剩4-8月,需尽早拥有安全公开的防御模型。
@emollick: 我们正处于企业AI最舒适的“正常技术”阶段:它能提升生产力,但仍需融入工作流程——这是我们已经见过的情形!
企业AI处“正常技术”阶段:提效但需集成,这或为过渡点,AI将自我整合。
若AGI可实现且仅公开模型才禁止内部使用,三大实验室或通过扩张收购独享价值,共享有风险
若AGI可行,三大实验室可能选择扩张收购独享价值,因共享AI会引发风险。