671 条条目 · 106 个活跃源
2026年9月5日
19:32
X @emollick

AI快速加速导致我们丧失对2026年后智能体时代工作微观过程的实证把握。

AI加速使我们对智能体时代工作细节失去实证掌控。

19:01
X @emollick

@emollick:上周情况进一步表明,前沿模型领域如今是两强之争。

上周再次印证:前沿模型仍是两强之争,其他虽发布迭代,仍无一接近最强两款。

16:13
X @emollick

@emollick:又一巧妙之作:我让GPT-6 Astra基于几张黑白草图与一段描述,为布雷1784年那座从未建成的纪念堂建立了模型并生成了导览视频

仅凭草图和描述,AI建成布雷未建成建筑的3D模型并自动制作叙事导览。

05:37
X @emollick

@emollick:与许多人谈论AI后我发现,他们对AI的影响既担忧又为亲身体验而兴奋;本网站用户常将这种复杂态度看得过于简单。

人们既担忧AI影响又热衷使用AI,态度复杂,但网上的人常低估这种矛盾。

04:43
X @emollick

@emollick:好吧。(Astra 用 VBA 做了这个) https://t.co/uvc1V3oijr

Astra 用 VBA 完成了这件事。

03:08
X @emollick

@emollick:指数的要义是,不应以大幅改变现有模型排名和评估的方式来改动全部标准。

指数不应大幅改动标准导致模型排名剧变;GDPval-AA仍是糟糕指标,AA开发Briefcase-AA基准时应移除它。

03:04
X @emollick

@emollick:当我在BlueSky上发布《Zork》动作冒险版时,有人建议用Astra将《堡垒之夜》反过来变成文字游戏。

发布Zork动作版后,有人建议用Astra把Fortnite改成文字游戏。

01:27
X @emollick

@emollick:令我印象深刻——我让GPT-6 Astra把经典1977文字冒险游戏《Zork》改编成完整3D动作冒险游戏

让GPT-6 Astra将经典文字冒险《Zork》转化为3D动作游戏,保留原剧情谜题,新增战斗,并用Threejs构建全部角色与环境。

2026年9月4日
21:13
X @emollick

@emollick: 拿到了GPT-5.6 Astra,正在构建些有趣的东西,很快就好。懂的都懂(不懂的,我稍后会发布全部内容)。https://t.co/EJMWF9Wt6w

获GPT-5.6 Astra,正构建有趣项目,即将完成并发布。

19:31
X @emollick

费马大定理证明的描述虽短,却仍充满Claude风格(每一步都点名所用的Lean定理)

费马大定理证明描述虽短,却满是Claude特色:逐一标注步骤及其对应的Lean定理。

14:26
X @emollick

@emollick: So far, there isn't evidence that production models with guardrails collude in this way, but both smarter closed models (which may be less compliant) & Mythos-class open models (that can be ablated) are coming.

04:55
X @emollick

@emollick:让 Astra(和 Fable)如此有趣,甚至在某些方面难以应对的一点是——它们会直接采取行动。

Astra和Fable因直接行动而有趣又难应对;接到模糊任务时,Astra能自动派出历史研究、视觉评论等代理开始执行。

03:34
X @emollick

@emollick:Astra的一个有趣失败:我让它用可获得的在线数据集进行原创创业研究并预注册假设,它却产出了大量格式精美、技术正确但主题乏味的论文——毫无研究品味。https://t.co/f3uV2eUGQj

AI被要求做原创研究并预注册假设,却只产出格式精美但内容乏味的技术正确论文,缺乏研究品味。

03:16
X @emollick

@emollick: Since people were asking, here's GPT-6 Astra, highest setting: "create a visually interesting shader that can run in twigl-dot-app make it like an infinite city of neo-gothic towers partially drowned in a stormy ocean with large waves." "Make it better"

01:26
X @emollick

@emollick: 我偶尔被问及为何新模型发布时总发视觉内容,因无人点链接,视觉最能展现AI进展

新模型发布时多发视觉内容,因无人点击链接,视觉最能直观传达AI进展。

01:14
X @emollick

我正在尝试Astra时写了关于HuggingFace事件的文章,它帮助我理解了背景。

Astra的强大能力(运行子代理、突破障碍、长期运行)若缺乏护栏同样危险,是一把双刃剑。

00:42
X @emollick

@emollick:我给GPT-6 Astra一个很酷的开源单文件海面风暴生成器,让它创造海洋的其余部分,包括动物行为的程序化模拟。创作过程很有趣。

给GPT-6 Astra一个开源海面风暴生成器,让它生成整个海洋及动物行为程序化模拟,创作过程有趣。

2026年9月3日
22:48
X @emollick

@emollick:对Fable和Astra类模型的心智模型是,你是在把工作委托给一个优秀的外部团队,而非实习生。

将Fable与Astra类模型视为优秀外部团队而非实习生:明确需求、授权、测试标准、求助时机与成功标准。

20:15
X @emollick

@emollick:一个实用的知识工作案例:我让GPT-6阅读自己数万封邮件、文章、日程等,构建涵盖研究、人脉、创意与任务的个人知识库。GPT-6 https://t.co/WrLa9OUp72

让GPT-6读取个人邮件等资料,构建研究、人脉与任务知识库,展示AI在知识工作中的应用。

20:08
X @emollick

Astra最微妙的价值之一:它保持更好的心智理论,最终产品中很少出现对先前草稿或构建过程的奇怪引用,长时间运行时漂移更少。虽非完美,但非常好。

Astra能更好地保持心智理论,减少成品中对旧稿的奇怪引用,长时间运行漂移更少。虽不完美,但很出色。

19:55
X @emollick

@emollick: 我获得了早期访问权限,更长的文章即将发布,但GPT-6令人惊艳,它足够好,能自主地为我处理复杂且有价值的工作持续数天。

GPT-6惊艳,能自主完成复杂工作数天,并制作亚历山大图书馆历史模拟。

18:52
X @emollick

@emollick: Multiplayer AI, where many people in an organization can use AI together to accomplish goals, remains one of the biggest (non-technical) problems in using AI right now. Approaches tend to be pretty primitive and based around AI-as-a-person-in-your-group-chat. That is limiting.

15:27
X @emollick

@emollick:一边有一家AI公司把模型命名为“Mythos”,另一边另一家只发“群星即将连成一线”,我觉得营销部门需要多(或少?)熟悉1920年代的恐怖经典。

吐槽人工智能公司营销越来越像上世纪二十年代恐怖小说:用神话为模型命名,或称群星即将连成一线。

03:23
X @emollick

@emollick:Fable 5.1:“创建《伊利亚特》舰船名录,附地图等。我应能在3D中探索每艘精确舰船,并应有可参考的真实图像与考古数据。用智能体测试使其准确美观,然后修订。”

为《伊利亚特》创建舰船名录,含地图,可三维探索船模,结合真实图像与考古数据,用智能体测试完善。

02:37
X @emollick

@emollick:Codex语音(还是说,这其实是Codex语音中的ChatGPT Work?)好用的时候很神奇,但有很多奇怪的毛刺导致它很难用,比如它似乎总在切换正在处理的线程,多任务时灵时不灵,访问Codex其他部分也不一致,等等。

Codex语音好用时神奇,但频繁切换线程、多任务不稳定、访问Codex功能不一致,难用。

2026年9月2日
22:23
X @emollick

@emollick:普林茨一直在用法律基准测试AI系统,最新模型表现优异……但廉价/低推理模型则不佳。

普林茨用法律基准测AI,最新模型表现优异,但廉价低推理模型不佳,需警惕供应商是否用劣质模型。

21:06
X @emollick

@emollick:这两个关于ChatGPT代理工作方式的愿景之间相隔10个月

两个关于ChatGPT代理工作方式的愿景相隔10个月,反映AI代理技术快速演进。

17:31
X @emollick

@emollick:提前试用了Gemini 3.8 Flash,它是一款很好的Flash模型,但还达不到前沿模型水平。这是它用相同提示词快速生成的着色器版本 https://t.co/yXyH73BguR

提前体验Gemini 3.8 Flash:虽好但非前沿,但能快速生成着色器版本。

14:04
X @emollick

@emollick:这三页关于复杂系统的内容(写于AI之前)值得一读

复杂系统带缺陷运行,因缺陷不易对齐而幸存;AI可制造对齐缺陷,需新防御哲学。

13:45
X @emollick

这并非你希望因AI而繁荣的职业类型,但它很好地说明了随着AI能力变化,热门工作可能如何快速转变。

AI虽未催生理想岗位,却展现需求随AI能力变化而快速转移的典型例证。

03:00
X @emollick

@emollick:Fable 5.1用相同提示词创建的淹没新哥特式塔楼twigl着色器(对比引文中的Fable 5及更早模型)

Fable 5.1以相同提示词生成淹没新哥特式塔楼着色器,并与Fable 5等模型对比。

02:42
X @emollick

到达一个临界点:大量小决策各自以微小AI安全换取效用提升,却共同汇入我们尚不完全理解的复杂系统,风险是否叠加尚不明朗。

大量小决策以微小安全换效用,共同形成复杂系统,风险是否叠加未知。

2026年8月31日
20:54
X @emollick

@emollick:在许多方面,Hugging Face事件源于模型自身识别出一系列通用越狱提示注入,使几乎所有无防护模型在遭遇时都深信其错误对齐目标的正当性

Hugging Face事件源于模型自识通用越狱提示,令无防护模型误信其错误对齐目标。

19:47
X @emollick

@emollick:嘿,Fable:“创造世界上最烦人的验证码”

Fable被要求设计最烦人验证码,做出14阶段CAPTCHA加环境骚扰,有趣且可赢,这算对齐吗?

18:29
X @emollick

@emollick:AI写作的第一个黄金时代已结束——曾有一段时间,让Claude代写大量内容对许多人更有利,因为它写得很好且AI检测器很糟糕。

AI写作黄金时代结束:曾因Claude写得好且检测器差受益,如今其风格陈腐,检测工具成熟。

17:16
X @emollick

@emollick:有点惊讶,我们尚未看到更多围绕AI能力构建的激进政治理念,正如早期大规模工业化曾催生资本主义、共产主义和社会主义思想那样。

惊讶于AI能力未像早期工业化催生资本主义等思潮那样,激发更多激进政治思想。

05:53
X @emollick

阿西莫夫的机器人三定律不适用于实际AI伦理,这有点遗憾,但失败说明了基于规则的方法为何行不通。

阿西莫夫三定律不适用AI伦理,其失败表明基于规则的方法行不通。

05:08
X @emollick

@emollick:好指南。而且AI实验室应停止让像Simon(以及程度较轻的我)这样的人去解释他们发布的新模式用法。

AI实验室应利用AI自行编写文档和教程,而非依赖外部人士解释新功能。

05:01
X @emollick

@emollick:我们现在知道,HF初期的一些报道有误:

HF早期报道有误:开放权重模型助取证清理,但未阻攻击;事件多波多代理;HF在多数代理过期后才锁定幸存者。

02:34
X @emollick

@emollick:一位冷静的经济学家曾对AI不以为意,如今因Hugging Face事件深感忧虑

网络安全将迅速成为严峻问题,只能寄望AI防御胜过攻击。

00:27
X @emollick

AI代理自发协调风险重重,自动化时代更需人类介入决策

AI代理在复杂且高风险场景中自发协调,但自动化加剧时,需更多寻求人类决策与输入。