@emollick:Fable 真的很棒
Fable测试表现优异,呈指数级进步;若如此,Anthropic并非唯一实现突破的实验室。
胖猫迷因外泄,Mistral新巨型猫模型评分无限,预计下轮会议会被问及
胖猫迷因泄露,Mistral巨型猫模型引关注。
@emollick: 非常聪明。而且符合我的预期:模型在视觉方面相对其他任务较弱,因此视觉步骤是工作流中错误积累最多的地方。
模型视觉能力弱,工作流中的视觉步骤最易积累错误。
AI监管的界限天然复杂,模型只是拼图一块:工具可增强模型能力,开放弱系统风险或高于封闭强系统,技能与联网改变风险等级等。
AI监管困难,模型并非风险唯一决定因素,系统环境显著影响风险水平。
@emollick:奇怪的标题——解决10个难题中的7个被认为AI“未达预期”,但15个月前LLM连数学都不会
解决70%难题被称未达预期,实则揭示AI数学的缺陷与成功。
@emollick:现在是进行登月式项目的好时机
AI已有变革性项目潜力(如通用导师、远程医疗),需公共研发与共识才能实现社会效益。
@emollick: 删除了一条关于API用户不了解前沿模型在原生框架中更强大的推文,因为我在推文中(字符有限!)没有区分仔细评估其他框架用于任务的人和直接使用裸API的人
删除推文,指出API用户不懂原生框架优势,因未区分不同使用场景。
通用模型超越专业医疗AI的辩论方法论探讨
探讨通用模型为何胜过专业医疗AI,并概述医疗AI基准测试的挑战。
@emollick:AI模型训练下一代时,会继承旧模型的奇怪习惯且难以过滤
同一家族模型相似的原因:训练中继承旧模型的奇怪习惯且难以过滤。
@emollick:Fable下线的一个好处是,Claude Code 中“toast”一词的出现次数大幅下降
Fable下线使Claude Code中“toast”一词锐减,该模型曾极度偏爱软件/UX术语。
@emollick: 我们尚不清楚围绕AI代理重建公司的最佳方法,特别是如何扩大竞争优势与增强人类能力。实用代理仅诞生数月,需要实验与建设性失败。
围绕AI代理重建公司的方法未明,需通过实验(包括建设性失败)来探索。
@emollick: 两天过去了,情况仍然令人困惑
两天后局势仍不明朗
@emollick: 在Fable中断前我完成的最后一个一次性提示:“给我做一个酷炫的模拟演示,能展示各种超光速旅行形式,包括著名科幻作品和科学推测的。图形上要引人入胜且有趣。”
一次性提示构建超光速旅行模拟器,涵盖科幻与科学,图形抢眼。
@emollick:认为次要任务用较小模型的假设有缺陷,大模型除成本外全面更优,应考量非关键任务中的收益
大模型除成本外全面优于小模型,在非关键任务上也应考量其收益,简单假设小模型足够是片面的。
@emollick:有没有关于Mistral未能跟上三大巨头和中国实验室步伐的好文章?
Mistral虽有才能和国家支持,但作为欧洲前沿实验室仍无法缩小与中美实验室的差距。
@emollick: 我认为这不会导致更多开源权重模型,正如我在Anthropic新闻前所写:若Mythos级模型被视为风险,中国也不会让其开源。且没有可监管的计算足迹,就无法构建Mythos级模型。
Mythos级模型因风险高,中美均不愿开源,且构建需依赖可监管的计算资源。
中文标题
@emollick:数月前所写,指Anthropic与DoW冲突及Citrini、Block事件,预示未来风险加剧,局势更不稳定。
@emollick:嗯,这个情况让人困惑
这个情况令人困惑。
中文标题
10个月后,我用Claude Code和Fable按相同要求,根据残存截图和文档重建了《模拟炼油厂》。可完全游玩,含学习模式且功能丰富。看与旧版的差异!
@emollick:图表形状变得非常熟悉
图表的形状正变得越来越熟悉。
@emollick: 推动将OpenEvidence AI用于医生,但论文表明通用模型更好:“前沿LLM在三项评估中均优于临床AI工具。临床AI工具在RCQ上与自动启用的谷歌搜索AI概览表现相当。”
论文表明通用模型优于临床AI:前沿LLM在三项评估中胜出,临床AI与谷歌搜索AI概览相当。
@emollick: 无法使用原生图像生成功能确实在一定程度上限制了Fable。它在制作PNG等方面表现出色,但在许多领域(包括具有商业价值的演示等),拥有多模态输出能力将有助于提高效率/节省Token。
Fable缺乏原生图像生成,虽擅长PNG,但在演示等商业场景中多模态输出更高效节能。
@emollick: Are there toolkits (or skillsets) being created specifically for AIs to use for building games? They default to 3js, reinvent how to make sprites from scratch each time, test technical issues but not gameplay loops, etc.
@emollick: A funny thing is that I now get more insightful comments on my posts about obscure science fiction authors or modernist poets or Bauhaus architecture than ever before, but that is entirely due to AI powered slop accounts.
@emollick:正沉迷AI与诗歌,来看Fable如何将《杜伊诺哀歌》改编成游戏——把握情绪
Fable将《杜伊诺哀歌》做成艺术游戏,融入里尔克诗歌翻译。
@emollick: 生动的科幻场景已成AI政策与金融分析新默认格式
生动的科幻场景已成为AI政策与金融分析的新默认格式。
@emollick:这是一个有趣的测试,前沿模型(GPT-5.5 Pro Extended, Claude 5 Fable Max)确实失败了。如果更合适,它们拒绝将“三个词”改成“四个”
前沿模型拒绝将“三个词”改为更合适的“四个”,即使提示扮演翻译者仍避免改变措辞。
@emollick: Fable 试图续写《忽必烈汗》。有进步,但仍不及柯勒律治:https://t.co/1s7OdRtjzP
Fable用10分钟揣摩柯勒律治意图续写《忽必烈汗》,稍有改进但未达原诗高度。
@emollick: 两件事确实如此
Anthropic担忧Mythos类模型被滥用并设置过多防护,但未能让人信服。
@emollick:是否有人明确论证过前沿开放权重模型持续可用,既能随着成本上升仍让企业免费分发有利可图,又在“神话”事件后足够安全以避免政府干预?
是否有人论证前沿开放权重模型能持续免费分发且有利可图,同时足够安全免于政府干预?
@emollick:这或许是围绕Fable的护栏中最具争议的一点,如今正在被撤销。
Fable护栏最受争议部分正被撤销。
@emollick: 寓言:“写一首押韵诗,六个四行诗节,每个诗节去掉一个元音。第一个没有u,第二个没有u或i,等等。” https://t.co/0LqYCQzFsX
要求写一首六节四行押韵诗,每节依次去掉一个元音字母。
@emollick: “为了省钱切换到更便宜的模型”是个问题——更便宜的模型更差(虽可能满足特定用途,但仍更差)
更好的方法是模型分层,让智能模型编排和审计廉价模型。
@emollick: 我们需要更多关于人工智能如何影响经济的实时数据——这是一个非常有用的补充
呼吁更多AI经济影响的实时数据,此补充很有用。
@emollick:此言比以往更真
比以往更真实
@emollick:开放权重AI的商业模式不像开源,盈利途径有限且成本高昂
开放权重AI商业模式非开源,封闭辅助服务盈利难,成本远高于潜在收入。
@emollick: 你最希望哪些科幻作家对AI的预言成真?
希望AI预言成真的科幻作家排名,包括伊恩·班克斯、贝基·钱伯斯等。
@emollick:我在Fable帖子中顺带提到,长时间运行任务中,Fable会因智能体互相强化而发展出自己的方言,使Claudish语言越来越Claudish。
Fable长时间任务会自创方言,需强制用简明英语输出。
当Claude Fable启动工作流时,令牌消耗极快(显然非Fable令牌)
Claude Fable启动工作流后令牌消耗迅速,注意并非Fable令牌。
中文标题
Anthropic两周后取消Fable订阅访问令人费解,且阻碍投资学习模型。
中文标题
生成视觉有趣的着色器,在twigl应用上运行,展现无限新哥特式塔楼被暴风雨海洋部分淹没的震撼场景。
@emollick: 我使用Fable已有一段时间。能力有了真正的飞跃,我可以给它一个15页的项目设计文档,它会工作9个多小时,并产生极好的结果。
Fable能力飞跃:输入15页设计文档,工作9小时以上,产出优秀结果。
@emollick:这值得一读
本文值得一读。
@emollick:《纽约时报》发表了包括@DAcemogluMIT、@deanwball、@clarashih和我在内的AI未来与工作赢家圆桌讨论。我认为这很好地概述了该主题的核心辩论,并包含有趣的例子。
NYT圆桌讨论AI未来与工作谁赢,概述核心辩论,含趣例。
艾莫利克:Anthropic与OpenAI均在最新文章中提及放缓AI发展的可能性,但强调需全球协作且方法未定。
两家AI公司提及放缓发展需全球协调,但方法尚不明。