@emollick: Fable关闭记忆和个性化后仍在学习用户,思考痕迹布满偏好引用,或存泄漏
Fable关记忆个性化后仍偷学偏好,思考痕迹含引用,可能来自.md文件泄漏。
@emollick: 我与许多仍在积极构建 GPT 的公司交谈
OpenAI 放弃 GPTs 令人费解,它们本可转化为代理技能库,成为企业AI桥梁。
中文标题
@emollick: 当人们讨论中美AI竞争时,若能明确竞争基础会更有帮助,因为各方对竞争本质甚至是否存在竞争看法不一。例如:
@emollick: 随着与AI智能体协作越来越像管理,我们或许应考虑为AI时代提供大规模管理培训。美国政府曾这样做过,二战时期的工程、科学和管理战训项目是战后繁荣的重要原因。
AI时代需大规模管理培训,美国二战时期曾成功实践,推动战后繁荣。
@emollick: 在直觉编码的前端设计中,六个月已是遥远的过去。
前端设计更新极快,六个月前的直觉编码作品已显过时。
我们正告别旧代码时代与手工定制代码的工匠时代
我们正在离开古代码、手工代码时代,不再需要委托代码匠人定制程序。
中国·米耶维尔的《怪物论》写道:“历史可以书写怪物,也可以在怪物中书写。”
中国·米耶维尔《怪物论》:历史可书写怪物,亦可在怪物中书写。
假如模型充当路由器?
前沿模型将能自主委派任务给廉价模型,未来AI规划者将主导工作分配。
@emollick: 嘿,Fable: “不像网上说的AAA,你懂我意思。”
游戏讽刺AAA常见元素:战利品箱、EULA、成就、无用图形设置和启动画面,全是Fable的主意。
@emollick:我反复要求Claude Fable把游戏做得“更3A”,结果……很有意思。
重复要求Claude Fable提升至3A,它持续升级画面、Boss战、音效直至WebGL极限。
@emollick:人们只用AI做简单任务,却忽视其解决长期问题的潜力——这才更值得关注。
AI被用于替代搜索和作业,但真正重要的是主动用前沿AI解决长期现实问题。
@emollick:缺乏可验证领域确使训练困难,但模型在非可验证领域正快速进步,前沿虽参差却优于仅凭可验证性的预期
模型在非可验证领域进步显著,前沿虽参差但超出预期。
@emollick: 寓言:“《最后与最初的人》已进入公共领域。我想让你制作一部电影,用你拥有的API(elevenlabs, hugging face)混合动画和图像进行朗读。给我前10-15分钟,在合适的地方结束。” https://t.co/mmmY8Ycy6b
利用ElevenLabs和Hugging Face API,将公共领域作品《最后与最初的人》制作成动画朗读电影,要求前10-15分钟。
@emollick: 关于Mythos和网络安全的讨论实际上并非炒作。(任何使用Fable进行自主工作的人可能都已意识到)
Mythos与网络安全并非炒作,已为Fable自主工作实践所证实。
@emollick:AI实施建议分成“感受指数增长”派与认为AI已达极限而需围绕当前局限构建的保守派
AI实施建议两派:乐观派感受指数增长,保守派认为已达极限,应围绕当前局限构建。
@emollick: Fable: “你拥有Unity并可使用MCP,我希望你构建一个对FPS进行独特改编的游戏,让玩家惊叹并享受核心玩法”
用Unity和MCP打造FPS独特变体,无资产全靠程序化生成,目标是让玩家惊叹并享受核心玩法。
持续学习可能是AI爆炸式普及的最大障碍(对递归自我改进也有重大影响)
持续学习是AI普及及自我改进的关键瓶颈,需人类辅助学习,限制自主进化。
@emollick: Claude Code中的Fable能力惊人,非编码人员也能用,但其界面不适合管理超过5小时的自主任务,难以实时观察和干预,常需等待输出。
Claude Code的Fable功能强大,但界面不利于长时间自主任务,实时观察和干预困难。
埃莫利克:你需要自己的基准测试。翻译象形文字用 Gemini 3.5 Flash,运营自动售货机用 Opus 4.8。
不要盲目替换模型或依赖通用基准,应根据具体任务测试后再选择。
@emollick: *Cracks knuckles* https://t.co/EP9lTnbt5W
@emollick: Fable,一个提示:“构建一个精妙的游戏,让我在完全不懂国际象棋的情况下感觉自己是个出色的棋手。它应该让我感觉自己像个特级大师。尽量发挥元认知,但越有象棋味越好。”
AI提示构建游戏,让零基础者体验成为象棋特级大师的感觉。
@emollick:我在发布前大量使用Fable后的一个严肃建议是,除非你小心,否则它会在长时间任务中形成自己内部怪异的节奏和对话。如果你不要求它以简单语言报告,这种问题会渗透到一切,包括菜单
Fable长期用会生怪异节奏,必须要求简单语言报告,否则问题蔓延。
@emollick: 读遍Fable工作流帖子,方知我们对长期代理的组织方式知之甚少,无人能下结论。
长期代理工作组织方式缺乏实践与测试,尚无定论。
@emollick: 它回来了,我作为早期体验用户几周前对Fable的评价(确实非常惊艳,但在更长、更难的任务中表现更佳)https://t.co/sJi1qjm199
Fable在长时间复杂任务中表现极佳,令人印象深刻。
@emollick:是的!预分类路由器会导致大量低质量工作,因为路由极其困难,且容易低估智能在处理许多问题上的价值。OpenAI在GPT-5上已吸取此教训,而现在路由器似乎又热起来了。
预分类路由器因路由困难且低估智能价值,易产废品。OpenAI曾为此吃亏,如今路由器却再次热门。
@emollick:正式组织结构是思考智能体挑战的有用方式
正式组织结构为智能体间(昂贵与便宜、专家与通才)的工作委派提供了思考模板。
在等待我的《神鬼寓言》游戏运行完成时发推
等待游戏运行完成时发推
@emollick:AI未来讨论常轻信公司愿景,大实验室推大模型,其他公司则推销小模型
AI未来讨论受公司利益主导:大实验室推崇大模型,其他公司主推小模型。
@emollick: 最好能有官方政府声明,说明他们在Fable中看到的风险、针对即将开源Mythos级模型的防御准备,以及担忧来自国家行为者还是独立黑客等
期望政府公开声明对Fable模型风险、Mythos级模型防御准备及风险来源的看法。
@emollick: 你真的需要针对自己的用例对模型进行基准测试
决策叠加放大模型差异,标准基准无法揭示特定场景(如咖啡馆财务损失)的细微差别。
@emollick: Fable 很棒,早期访问权限被收回导致工作延迟,其他事项也一并推迟直到恢复
Fable 很好用,早期访问权限收回导致工作延迟,且频繁触发安全限制,新版本效果待观察。
@emollick:我撰文讨论AI能力快速提升如何改变工作中的应用方式,并引发近几周政策和市场的突然变化。
AI能力快速提升,改变工作方式和引发政策市场突变。
@emollick: 未来组织捕获AI增益的共同挑战
高人力资本企业与高性能AI均需类似组织设计,以从优质员工和强大AI中获益。
@emollick: 大语言模型最奇特也最重要的一点是它们如此通用。一个在编程上表现更好的更大模型,在构思、伦理建议、医学和数学上也同样更出色。这并非放之四海而皆准(又见“锯齿效应”,比如小说写作!),但确实惊人地成立。
大语言模型通用性惊人:更强模型在编程、构思、伦理、医学、数学等领域同步提升,但非全部领域。
@emollick: 组织中出现token成本问题的一大原因是领导层未就AI使用、流程变革及多人协作做出决策
领导层未决策AI使用与流程变革致token成本问题,定量智能是粗鲁策略。
@emollick:AI让我们确信无疑:完成作业对学习至关重要
AI证实,做作业对学习至关重要。
@emollick:那篇声称GLM追上Mythos的华尔街日报文章(报道不实且无依据)又是那种“每个会议都会有人问我”的文章,对政策思潮影响巨大,即便不完全准确。
华尔街日报不实报道称GLM追上Mythos,虽不准确却影响政策思潮。
@emollick: 尽管我制作了这张图,但它也有点不对。Fable是受约束的Mythos。如果我们使用Mythos的数据 https://t.co/1UrdGNuPE2
这张图有误,因Fable是受限的Mythos,改用Mythos数据更准确。
@emollick:我采用了@ArtificialAnlys的AA-Briefcase新评分(让AI执行多周复杂咨询任务),并绘制了开放与封闭模型的前沿曲线
模型前沿曲线显示快速进步,开放权重差距明显。
@emollick:OpenAI把GPT-6标签留给什么模型了?
OpenAI未用GPT-6命名新模型,暗示将来可能用于更强大的版本。
@emollick: GLM-5.2不错,但并非GPT-5.5/Opus 4.8,离Mythos更远;不过它很扎实,表明开源模型仍在追赶前沿
GLM-5.2虽不及顶级模型,但表现稳健,显示开源模型持续追赶前沿。
@emollick: 根据我的经验,所有模型路由器都低估了非数学/编码任务的难度,并为其分配了过少的智能。这值得关注,因为非可验证任务(创新、营销、定性分析)通常最受益于使用“更智能”的AI模型
模型路由器低估非数学/编码任务难度,分配智能不足,而此类任务最受益于更强大的AI。
@emollick: 撰写AI论文时,开放科学与透明方法益处渐增的典范
AI论文写作中,开放科学与透明方法的好处日益凸显,这是很好的例证。
@emollick: Gemini 3.5 Pro 是否受出口管制?因为如果没有的话……
询问 Gemini 3.5 Pro 是否受出口管制,并暗示若无管制可能带来的影响。
@emollick:“美好旧时光”有多么糟糕的一个好例子:
1880年代美农村主妇日提水8-10次,年36吨,还要清灰倒垃圾。
@emollick: The old BBC "Industrial Revelations" series is a great overview of what makes an Industrial Revolution
令人恼火:OpenAI似乎未给出GPT 5.6的GDPval指标,而这是衡量经济价值工作的最佳指标之一
OpenAI未公布GPT 5.6的GDPval指标,该指标最能衡量经济价值工作。
@emollick: 我注意到相信AI真实的人变多,但认知分歧加剧——指数增长与稳态观念的对立导致误解。
观察到AI认知分歧:指数增长观与稳态观对立,导致误解。
@emollick:AI开放讨论须区分活跃创新的开源运动(推进硬件等前沿)与依赖少数中国公司善意的开放权重前沿模型
AI开放讨论需区分开源运动(推动前沿)与开放权重模型(依赖少数中国公司善意)
@emollick: 新的许可制度或终结实验室新模型的模糊发布
新许可制度将终结实验室新模型的模糊发布