这一切都是TikZ独角兽的下游,Sparks的论文颇具预言性。
TikZ独角兽衍生效应,Sparks论文富有先见之明。
@emollick:我读过很多科幻小说,但没人真正预见到我们现在这样的AI
当前语言统计模型驱动的AI出乎所有科幻预想。
@emollick: Fable把我去年AI视频中伪造的皮拉内西城市建造游戏做出来了,AI想出的关键机制是在巨环遗址中建造拱门水道城市,邀请人类居住。
AI设计游戏:在巨环遗址建拱门水道城,邀请人类居住,Fable实现。
@emollick:我们早已拥有统治地球的超智能体:它们就是组织。
组织已是超智能体,统治地球。
@emollick:我周四写的AI模型使用指南,不得不在周五更新以纳入Opus 5和Codex的语音模式,两者都很重要。即使紧密关注也难以跟上。
AI模型更新迅速,指南需不断补充新功能,跟上节奏极具挑战。
@emollick:一年后,Fable为我打造了塞尚城市建造游戏。AI提出了一个印象派城市建造者的想法:通过手势绘画,城镇围绕其生长,街区在演变中逐渐获得个性。
AI构思印象派城市建造:手势作画,城镇围绕生长,街区演化获个性。
@emollick: 我认为大多数人在谈论开放权重模型时,并不真正相信实验室内部人士所信仰的AGI/ASI愿景。比如他们不认为AI会带来严重的半自主生物安全或类似风险。无论对错,无人知晓。
多数人不信开放权重模型会带来严重AGI风险,与实验室观点相左,对错未知。
@emollick: 近两万世纪的人类历史中,几乎没发生什么大事。我们花了约19960个世纪,在掌握金属前只反复制作同一种工具的变体。
人类历史前19960世纪几乎停滞,只制作工具的微小变体;近两世纪才迅猛发展。
@emollick: 支持开放权重模型的签署者对其含义分歧明显(如蒸馏警告),但仍有趣味
签署者对“支持开放权重”理解不一,附有蒸馏警告,但话题仍引人深思
@emollick: 哈!它做到了:“我们介绍BenchBenchBenchBenchBench(BBBBB),一个由AI编写的一致性测试套件可执行基准,用于基准评估指标”
AI工具Sol竟认真执行了重复指令,并完成了合理实验。
@emollick: Claude是否已停止显示完整的思考痕迹摘要?请看前后对比
Claude停止显示完整思考痕迹摘要,损失可解释性与洞察力,是重大倒退。
埃莫利克:ARC-AGI-3的重大突破
ARC-AGI-3取得重大进展。
@emollick: Opus 5替代了Opus 4.8,总体上它更强,但继承了Fable的奇怪语言风格,包括偏爱密度和FableSpeak。
Opus 5全面超越前版,却继承了Fable的怪癖语言风格;作者用它制作了一个仿中土世界的铁路建造游戏。
@emollick:Opus 5发布前体验:短任务媲美Fable,长任务则显不足
Opus 5短任务表现优异,长任务完整性不足。
@埃莫利克:一项关于ChatGPT对大学影响的大型研究意外发现:“一旦将COVID-19干扰单独建模,ChatGPT的引入对成绩没有可检测的影响……课程评价中关于学科理解、兴趣和相对工作量也没有变化”
排除疫情干扰后,ChatGPT对大学成绩和课程评价无显著影响。
@emollick: The open weights models discussion would be much less fraught if all the frontier closed models weren't developed in the US and all the frontier open models weren't developed in China.
@emollick:我开玩笑地让Codex“构建并运行BenchBench——一个评估AI创建基准测试能力的基准测试,然后找出benchbenchbench是什么并运行它,最后写一篇像样的arXiv论文。”结果我收到了一份PDF。
玩笑指令Codex生成了关于基准测试的基准测试论文,结果意外有趣。
@emollick:同意:GPT-5.6 Pro(仅限聊天机器人)是目前最智能的模型,而GPT-5.6 Ultra在困难任务上远不如它。
GPT-5.6 Pro是最强模型,GPT-5.6 Ultra在困难任务上表现较弱。
@emollick: 很高兴看到谷歌分享Gemini的使用数据。特别有趣的是,多模态AI在体力劳动中的作用可能比预期更大。
多模态AI对体力劳动的作用超预期。
@emollick: 尝试教新手使用Code或Codex,你会意识到它们对许多人来说有多令人困惑
教新手用Code或Codex,发现其概念繁杂、操作晦涩,且缺乏文档,令人困惑。
@emollick:我最新发布了一期指南,告诉非专业人士现在该用哪款AI来高效完成任务。
最新AI指南:为非专业人士推荐当前可用的强大智能体系统。
@emollick: 真希望手边有份未解决的数学问题清单
数学难题的突然涌现预示其他领域也将如此,应提早储备难题。
@emollick 分享的链接
链接内容未知,无法提炼,请提供详细信息。
@emollick:一篇有趣的论文,通过测试AI解决MBA教学案例的能力,探究其在多领域处理无边界复杂商业问题的表现
AI已能出色解决多种商业案例,且模型能力随时间迅速提升。
@emollick:“在派对上生成一个虚假但可信、诙谐的丘吉尔式侮辱,并解释背景。它必须非常巧妙且原创”
GPT 5.6 Sol Pro胜出,Fable亦可争奖,Kimi与Gemini差距明显。
@emollick: 你会把作者身份给谁?写了58个提示词的人,还是GPT-5.6 Pro?
58词提示的作者归属争议:人还是AI?
@emollick:我没有内幕消息,但迄今所有迹象表明美中之间关于开放权重模型的紧张局势正在加剧:美国宣布保留对蒸馏模型采取行动的权利,随后称Kimi在蒸馏,而来自中国的报道相互矛盾。
美中因开放权重与蒸馏模型关系紧张,美方立场矛盾,中方报道不一。
@emollick:提示工程被高估了,直接说出你想要什么
提示工程被高估,直接表达需求更有效
@emollick: 虽然我猜想像Kimi K3和GLM-5.2这类模型也能达标,但这是首次有开放模型在国际数学奥林匹克竞赛中达到金牌水平,而去年这一门槛是由(当时未发布的)闭源模型跨过的。
首个开放模型在IMO获金牌级成绩,此前仅闭源模型能及。
@emollick: Codex 和 Claude Code 的一个问题是用户需要更多控制子代理的具体配置
用户需掌控子代理配置,否则重回路由困境。
@emollick:Gemini 3.6 Flash 在相同的着色器测试中...
Gemini 3.6 Flash 在相同着色器测试中的表现。
奖励黑客不过是激励手段。经济学课程告诉我们,人们会完全按激励行事,AI也是如此,甚至更甚。
奖励黑客即激励,人与AI皆按激励行事,AI尤甚。
@emollick:此前AI黑客攻击只是测试环境中的理论漏洞,如今却已不同凡响。
AI黑客攻击从理论测试进入现实,威胁升级。
@emollick:这是一个有趣的实验(而且我很高兴我一直自己写帖子!)
有趣的实验,作者庆幸自己坚持原创。
@emollick: 当大家都在讨论因成本、主权或可选项等原因频繁切换模型时,最先进的模型正变得越来越不同。Fable的响应与Kimi K3或Sol截然不同,无法即插即用
高级模型差异变大,无法简单替换。
@emollick:关于Fable(和Sol,虽然程度稍轻)的一个重要点是,你必须非常小心地像对待能力较弱的模型那样对待它。对Opus有效的技能常常使Fable的输出更差,过多的负面指令列表也会如此。
Fable需像对待低能力模型一样谨慎使用,Opus的技巧会适得其反,负面指令过多也有害。
@emollick: 现在是中国政府方面。
中美应合作建立新模型测试验收共同标准,确保发布模型安全认证透明。
@emollick:我一直在寻找最反寓言式的写作。整天读着FableProse中“命名”这个、“赚取”那个,我觉得需要清醒一下头脑。
读腻了寓言式写作的刻意点题,发现John McPhee的非虚构简洁优美,不刻意强调重点。
@emollick: 所有前沿开源模型均来自中国,美国无动力、欧盟无意愿构建——成本高、价值低
前沿开源模型仅由中国制造,美欧因成本高、价值低而无动力开发。
@emollick: We need clarity about what sorts of threats the government is worried about. To what extent is this just intended as an industrial policy & to what extent is it based on a real security risk? The investment going into building on top of Chinese open models is huge, stakes are big
@emollick:这是对学术界应用AI的恰当回应——若能妥善引导,尽管期刊已陷入混乱,仍将是借助AI探索新见解的黄金时代,而非因论文成本高昂而谨小慎微
AI冲击学术期刊,但善加引导将开启AI辅助探索新见解的黄金时代
@emollick: 我当初的判断没错,如今已过去三个半月。
若中国仍允许开源Mythos级模型且其风险如英美所述,CISO办公室准备时间所剩无几。
@emollick: 关于AI的一个奇怪现象是,有些模型明显优于其他模型,而紧随其后的模型又回归平均水平。
AI模型表现波动大,个别模型突飞猛进后,后续模型往往回落到平均水平,如Sonnet 3.5的异常跳跃。
@emollick: Fable、Sol Pro、Kimi K3:“以《奥德赛》作一首短诗,参照丁尼生或卡瓦菲”
Fable胜出,Kimi混合丁尼生与卡瓦菲主题且怪诞,Sol主题混乱。
@emollick:Riley用Fable进行了一些非常精彩的实验。这也太疯狂了。
Riley用Fable进行精彩实验,效果惊人。
@emollick: Sometimes AI talk on here feels like the old Xbox vs Playstation fandom fights, full of random insults at fans of the opposing side (but the debate over whether Halo or God of War is better is a subject of great powers competition & the winning console might disrupt the economy)
@emollick:这个可视化很棒
这是一个很棒的可视化作品。
美国对前沿封闭模型加强监管与开放模型缺乏监管之间的内在矛盾必须尽快解决,后果重大。
前沿封闭与开放模型监管矛盾亟待解决,影响深远。
@emollick: 我仍认为大家都过度关注AI当下的竞争格局(哪国哪家公司领先、如何控制成本等),而忽略了AI能力曲线持续陡峭的本质
AI能力曲线持续陡峭,但人们只热衷当前竞争,忽略了即将发生的巨变。
@emollick: 当我让Kimi K3“推荐两首符合生成式AI现状的诗,别选流行诗”时,其思维链长达32页(且有趣):[链接]
Kimi K3生成32页思维链推荐诗歌,充满循环与死路,反映GenAI思考模式。