676 条条目 · 106 个活跃源
2026年7月10日
21:36
X @emollick

@emollick: ChatGPT Work和Cowork是知识工作者的错失机会,而Google NotebookLM用相同70+文件回答问题,注重过程与来源。

Google NotebookLM注重过程与来源,对比ChatGPT Work的错失机会。

20:01
X @emollick

@emollick:那工作的意义是什么?只是一个简化版的Codex,偷偷写代码却隐藏起来?

这个产品只是简化版Codex,缺乏愿景和新功能,令人困惑。

19:02
X @emollick

@emollick: 寓言:八年级学生未读原著就做《了不起的盖茨比》PPT,字体选择妙趣横生。

模拟学生未读原著做PPT,字体幽默,效果滑稽。

18:23
X @emollick

@emollick: 这次是使用公开模型的新颖数学证明(其他重大数学突破大多来自实验性大语言模型)

使用公开模型完成新颖数学证明,此前重大突破多来自实验性LLMs。

18:00
X @emollick

@emollick:一项关于AI与工作的早期关键研究显示,GPT-4的建议让高绩效创业者利润提升,但困境中的创业者因无法执行建议而表现更差。

GPT-4建议对高绩效创业者有益,却让困境中的创业者业绩更差。

15:55
X @emollick

@emollick: Fable在长期项目中冒出违禁念头并中止项目,极其恼人

Fable因参考文献页触发违禁思考,导致长期项目中止。

15:02
X @emollick

@emollick: 领先模型在个性与方法上首次显著分化,且长期任务中判断与方式的差异会放大。你真的需要为自己或公司测试这些模型。

领先模型首次显著分化,长任务差异放大,建议自行测试。

13:58
X @emollick

@emollick: 新的ChatGPT语音功能使用体验令人惊艳,真值得在手机上花一分钟试试(但需注意语音模型智能不及完整推理模型)

ChatGPT新语音功能惊艳,值得手机一试,但智能不及完整推理模型

05:44
X @emollick

@emollick:实验室应推出直观的新模型对比,展示不同级别模型的作品样例

呼吁实验室提供直观模型对比,展示各层级作品,分析错误率与用户偏好。

03:46
X @emollick

@emollick:当GPT-5推出时,我创建了一个程序化粗野主义城市建造者作为演示(你可以在引用的推文中看到)

用GPT-5.6 Sol在Codex中零代码创建程序化粗野主义城市建造者,不到一年实现。

2026年7月9日
23:26
X @emollick

@emollick: 给所有AI实验室的提示,当它们从编程扩展到通用知识工作时:非编程者不仅是更笨的编程者

非编程者并非更笨的编程者,知识工作需要更多控制与可见性。

22:25
X @emollick

@emollick:这让人困惑...

对Claude Cowork有理解,但困惑ChatGPT Work与Codex的功能差异。

19:00
X @emollick

@emollick: 使用Codex与5.6 Sol的真实工作案例

AI用30分钟审校新书PDF,给出几十条笔记,无错误但多数过于琐碎。

17:22
X @emollick

@emollick: GPT-5.6已上线,先分享预览中最蠢的项目:制作一款名为“别谈论哥布林”的游戏。

GPT-5.6从提示生成游戏创意,设计了巧妙机制和图形。

17:13
X @emollick

@emollick:真美妙。与虚拟威廉·西格哈特畅谈浩瀚与记忆风景,引出济慈与霍普金斯诗歌的优美朗诵。

与虚拟人物对话引发诗歌朗诵,展示AI美好人性化演示。

16:23
X @emollick

@emollick:看起来SpaceX/Grok和Meta/Muse已在近前沿类别中跟上步伐,同时推出廉价、快速、封闭的专用编码模型新类别

SpaceX/Grok和Meta/Muse重返前沿,推出廉价快速封闭的专用编码模型。

16:08
X @emollick

@emollick:是的,AI确实让作弊(包括“求助”而非作弊)问题更严重,但问题本身早已存在

AI加剧作弊,互联网使抄袭便捷,作业提升成绩比例从86%降至45%。

13:05
X @emollick

@emollick: 还有这张图展示了什么是“AI上瘾”的初创公司,以及即使在初创公司中这种情况有多不常见:当创始人被问到“如果没有生成式AI,你需要额外雇佣多少员工才能保持当前产出且质量不变?”时的答案

图示AI重度依赖的初创公司罕见:无GenAI需多雇员工方能维持产出与质量。

05:53
X @emollick

@emollick: 一个值得关注的问题是,SpaceX/特斯拉等公司能否实现所需的组织变革,以充分利用其同时作为AI实验室的优势。

关注SpaceX等公司能否成功进行组织变革,以充分利用其AI实验室的优势。

04:37
X @emollick

@emollick:今晚我一直在给每个模型制造者挑一些微小但重要的问题,再多说一个:Grok 4.5没有模型卡。试图在前沿竞争的公司应该发布模型卡和测试结果,而不仅仅是基准测试!

批评Grok 4.5缺模型卡,呼吁前沿公司发布模型卡和测试结果,而非仅基准。

04:13
X @emollick

@emollick:OpenAI的指标讨论让我有点困惑。我感谢关于糟糕基准的澄清,但他们花了很多钱开发了一个非常好的自主模型在困难任务上的基准测试GDPval,却没有报告GPT-5.6的结果。

OpenAI花巨资开发优秀基准GDPval却未报告GPT-5.6结果,仅澄清低质基准,令人困惑。

04:05
X @emollick

绿线上的最后一个点之后有相当长的间隔

绿线末端出现长间隔

04:01
X @emollick

@emollick: 管理者对AI价值的信念与使用方法决定实际收益——初创企业研究

管理者对AI价值的信念与使用方法决定了实际获得的价值,研究聚焦初创企业。

2026年7月8日
23:15
X @emollick

@emollick: Added Grok 4.5 to the Harbor Town Playable gallery. Here is it's "build me a procedurally generated 3D simulation showing the evolution of a harbor town from 3000 BCE to 3000 AD, it should look beautiful and allow me to have some control over it"

20:16
X @emollick

@emollick:在 Grok 4.5 中使用相同系列提示生成淹没在暴风雨海中的新哥特式城市的 twigl 着色器

Grok 4.5 生成新哥特城市沉没暴风海的 twigl 着色器提示,初始代码正确但超出浏览器显示范围。

18:54
X @emollick

@emollick: 我经常使用Pinokio下载并操作本地开源AI工具/模型,它的一个巧妙之处是能无缝地将这些工具/模型暴露给Code和Codex。

Pinokio让本地AI模型无缝对接Code/Codex,GPT-5.6曾自动用它们替代付费API。

18:32
X @emollick

@emollick: 甚至没时间写下对新GPT语音的早期体验,但它真的很棒,更接近与AI对话的科幻体验(部分因它更聪明)。再加上Claude标签,暗示着与AI协作的新模式正在出现。

新GPT语音更智能,接近科幻对话体验,与Claude标签预示AI协作新模式。

06:15
X @emollick

@emollick: Sol与Fable实现模型飞跃,大幅领先其他AI,是智能工作的唯二选择

Sol和Fable模型大幅领先其他AI,是智能工作的唯二选择。

04:30
X @emollick

@emollick:我是GPT-5.6 Sol的早期测试者,被要求发布前不分享演示,但这是个非常好的模型。

早期测试者称GPT-5.6 Sol与Fable能力相近但更快更协作,是优秀模型。

01:29
X @emollick

@emollick:我让Fable构建了一个一直想要的东西——完整程序化奇幻王国生成器,包含经济、贸易、人口、战争、世系和巨龙。先制定计划,再让它生成

先与AI制定计划,生成包含经济、贸易、战争、世系和巨龙的程序化奇幻王国。

2026年7月7日
20:44
X @emollick

@emollick:MAI-1尚无独立基准,但已发布基准显示其不如Sonnet 4.6

MAI-1基准逊于Sonnet 4.6,办公Copilot前景存疑,已有更优AI插件。

17:24
X @emollick

@emollick: Fable的过度华丽语言是软件与设计项目中持续存在的问题,尽管AI其他方面表现出色,它仍会悄悄渗入文本、提示框和菜单,难以彻底清除。

Fable的华丽语言难以清除,即使AI优秀,也会渗入文本和菜单。

14:14
X @emollick

@emollick:这是我不期望前沿开放权重模型的发布能无限期持续甚至持续很久的一个关键原因。https://t.co/Q8RKnBJaR4

前沿开放权重模型无法长期持续发布的关键原因。

05:14
X @emollick

不出意料但仍影响重大:MTurk即将退出舞台

MTurk曾是社科调查研究主力,因LLM兴起正被AI取代。

04:22
X @emollick

@emollick: 从首个扩散DOOM开始玩这些世界模型/游戏,20帧多人体验不错。"火箭联盟之梦",诚哉斯言。

我自首个扩散DOOM起玩这些世界模型/游戏,20FPS多人模式不错,真可谓"火箭联盟之梦"。

04:17
X @emollick

@emollick: AI的执念,续:命名行为、事物是否“应得”、什么“承载”其他、牵强的隐喻、与想法共处、无生命概念“活着”、以伪深刻的诚实反思结束段落

AI的执念:命名、应得、承载、牵强隐喻、与想法共处、无生命概念“活着”、伪深刻反思结尾。

01:41
X @emollick

@emollick:研究表明,早在智能体革命之前,提示技巧就已不再非常有价值

最佳AI方法:清晰指定目标、输出、好坏标准及测试方式,本质即管理。

2026年7月6日
20:22
X @emollick

@emollick: 从 Opus 4.5 到 Fable,PotatoMonetBench 取得巨大进步:"有两个控制器。一个是滑块,一侧标有'Maximum Potato',另一侧标有'Formalware',有四个档位。另一个是拨盘,从'Monet'到'Drive-Thru'。" https://t.co/mr8o0usi3r https://t.co/2iXq15IJhv

PotatoMonetBench从Opus 4.5到Fable进步巨大,控制器为四档滑块(最大土豆/正式餐具)和拨盘(莫奈至免下车)。

18:49
X @emollick

@emollick: 有趣的内容。最后的可视化值得一试:https://t.co/fFOXrFfryc

@emollick分享有趣内容,末尾可视化值得尝试。

18:37
X @emollick

@emollick: Anthropic和OpenAI将越来越能够以极低成本提供前沿AI的较弱版本(Haiku, Instant)

Anthropic和OpenAI能以极低成本提供弱化版前沿AI,并通过模型组织实现更低成本、更高性能。

14:23
X @emollick

@emollick: 我敢保证你给Fable分配的任务绝不够有野心

先要求最大任务以探索极限,再根据系统限制下调请求。

06:19
X @emollick

删除此条:因发现在一台电脑的Claude Code中误留了允许写入内存文件的设置

因设置失误导致Claude Code可写入内存文件,疑为自身疏忽。

04:20
X @emollick

@emollick: 不到两年后,用Fable:“模拟一个灵吸怪与一个同等挑战等级的卓尔战士的遭遇。设置初始属性,模拟每一步(含先攻、掷骰),从相距60英尺开始,用3D模拟展示结果”

Fable模拟灵吸怪与卓尔战士(同CR)对战,从60英尺起,含初始数据、先攻及掷骰,以3D呈现结果。

02:39
X @emollick

中文标题

@emollick:猜测AI系统Fable可能更擅长做它“喜欢”的任务,否则只是机械完成,但测试成本高,纯属推测。