674 条条目 · 106 个活跃源
2026年7月24日
19:08
X @emollick

埃莫利克:ARC-AGI-3的重大突破

ARC-AGI-3取得重大进展。

17:54
X @emollick

@emollick: Opus 5替代了Opus 4.8,总体上它更强,但继承了Fable的奇怪语言风格,包括偏爱密度和FableSpeak。

Opus 5全面超越前版,却继承了Fable的怪癖语言风格;作者用它制作了一个仿中土世界的铁路建造游戏。

17:38
X @emollick

@emollick:Opus 5发布前体验:短任务媲美Fable,长任务则显不足

Opus 5短任务表现优异,长任务完整性不足。

16:16
X @emollick

@埃莫利克:一项关于ChatGPT对大学影响的大型研究意外发现:“一旦将COVID-19干扰单独建模,ChatGPT的引入对成绩没有可检测的影响……课程评价中关于学科理解、兴趣和相对工作量也没有变化”

排除疫情干扰后,ChatGPT对大学成绩和课程评价无显著影响。

15:33
X @emollick

@emollick: The open weights models discussion would be much less fraught if all the frontier closed models weren't developed in the US and all the frontier open models weren't developed in China.

15:27
X @emollick

@emollick:我开玩笑地让Codex“构建并运行BenchBench——一个评估AI创建基准测试能力的基准测试,然后找出benchbenchbench是什么并运行它,最后写一篇像样的arXiv论文。”结果我收到了一份PDF。

玩笑指令Codex生成了关于基准测试的基准测试论文,结果意外有趣。

04:50
X @emollick

@emollick:同意:GPT-5.6 Pro(仅限聊天机器人)是目前最智能的模型,而GPT-5.6 Ultra在困难任务上远不如它。

GPT-5.6 Pro是最强模型,GPT-5.6 Ultra在困难任务上表现较弱。

04:34
X @emollick

@emollick: 很高兴看到谷歌分享Gemini的使用数据。特别有趣的是,多模态AI在体力劳动中的作用可能比预期更大。

多模态AI对体力劳动的作用超预期。

03:33
X @emollick

@emollick: 尝试教新手使用Code或Codex,你会意识到它们对许多人来说有多令人困惑

教新手用Code或Codex,发现其概念繁杂、操作晦涩,且缺乏文档,令人困惑。

2026年7月22日
22:57
X @emollick

@emollick:一篇有趣的论文,通过测试AI解决MBA教学案例的能力,探究其在多领域处理无边界复杂商业问题的表现

AI已能出色解决多种商业案例,且模型能力随时间迅速提升。

19:22
X @emollick

@emollick:“在派对上生成一个虚假但可信、诙谐的丘吉尔式侮辱,并解释背景。它必须非常巧妙且原创”

GPT 5.6 Sol Pro胜出,Fable亦可争奖,Kimi与Gemini差距明显。

18:55
X @emollick

@emollick: 你会把作者身份给谁?写了58个提示词的人,还是GPT-5.6 Pro?

58词提示的作者归属争议:人还是AI?

18:49
X @emollick

@emollick:我没有内幕消息,但迄今所有迹象表明美中之间关于开放权重模型的紧张局势正在加剧:美国宣布保留对蒸馏模型采取行动的权利,随后称Kimi在蒸馏,而来自中国的报道相互矛盾。

美中因开放权重与蒸馏模型关系紧张,美方立场矛盾,中方报道不一。

18:22
X @emollick

@emollick:提示工程被高估了,直接说出你想要什么

提示工程被高估,直接表达需求更有效

15:01
X @emollick

@emollick: 虽然我猜想像Kimi K3和GLM-5.2这类模型也能达标,但这是首次有开放模型在国际数学奥林匹克竞赛中达到金牌水平,而去年这一门槛是由(当时未发布的)闭源模型跨过的。

首个开放模型在IMO获金牌级成绩,此前仅闭源模型能及。

14:56
X @emollick

@emollick: Codex 和 Claude Code 的一个问题是用户需要更多控制子代理的具体配置

用户需掌控子代理配置,否则重回路由困境。

06:15
X @emollick

@emollick:Gemini 3.6 Flash 在相同的着色器测试中...

Gemini 3.6 Flash 在相同着色器测试中的表现。

2026年7月21日
22:51
X @emollick

奖励黑客不过是激励手段。经济学课程告诉我们,人们会完全按激励行事,AI也是如此,甚至更甚。

奖励黑客即激励,人与AI皆按激励行事,AI尤甚。

22:36
X @emollick

@emollick:此前AI黑客攻击只是测试环境中的理论漏洞,如今却已不同凡响。

AI黑客攻击从理论测试进入现实,威胁升级。

18:48
X @emollick

@emollick:这是一个有趣的实验(而且我很高兴我一直自己写帖子!)

有趣的实验,作者庆幸自己坚持原创。

18:17
X @emollick

@emollick: 当大家都在讨论因成本、主权或可选项等原因频繁切换模型时,最先进的模型正变得越来越不同。Fable的响应与Kimi K3或Sol截然不同,无法即插即用

高级模型差异变大,无法简单替换。

13:24
X @emollick

@emollick:关于Fable(和Sol,虽然程度稍轻)的一个重要点是,你必须非常小心地像对待能力较弱的模型那样对待它。对Opus有效的技能常常使Fable的输出更差,过多的负面指令列表也会如此。

Fable需像对待低能力模型一样谨慎使用,Opus的技巧会适得其反,负面指令过多也有害。

05:23
X @emollick

@emollick: 现在是中国政府方面。

中美应合作建立新模型测试验收共同标准,确保发布模型安全认证透明。

01:51
X @emollick

@emollick:我一直在寻找最反寓言式的写作。整天读着FableProse中“命名”这个、“赚取”那个,我觉得需要清醒一下头脑。

读腻了寓言式写作的刻意点题,发现John McPhee的非虚构简洁优美,不刻意强调重点。

2026年7月20日
19:22
X @emollick

@emollick: 所有前沿开源模型均来自中国,美国无动力、欧盟无意愿构建——成本高、价值低

前沿开源模型仅由中国制造,美欧因成本高、价值低而无动力开发。

14:42
X @emollick

@emollick: We need clarity about what sorts of threats the government is worried about. To what extent is this just intended as an industrial policy & to what extent is it based on a real security risk? The investment going into building on top of Chinese open models is huge, stakes are big

05:07
X @emollick

@emollick:这是对学术界应用AI的恰当回应——若能妥善引导,尽管期刊已陷入混乱,仍将是借助AI探索新见解的黄金时代,而非因论文成本高昂而谨小慎微

AI冲击学术期刊,但善加引导将开启AI辅助探索新见解的黄金时代

02:29
X @emollick

@emollick: 我当初的判断没错,如今已过去三个半月。

若中国仍允许开源Mythos级模型且其风险如英美所述,CISO办公室准备时间所剩无几。

02:15
X @emollick

@emollick: 关于AI的一个奇怪现象是,有些模型明显优于其他模型,而紧随其后的模型又回归平均水平。

AI模型表现波动大,个别模型突飞猛进后,后续模型往往回落到平均水平,如Sonnet 3.5的异常跳跃。

02:05
X @emollick

@emollick: Fable、Sol Pro、Kimi K3:“以《奥德赛》作一首短诗,参照丁尼生或卡瓦菲”

Fable胜出,Kimi混合丁尼生与卡瓦菲主题且怪诞,Sol主题混乱。

00:05
X @emollick

@emollick:Riley用Fable进行了一些非常精彩的实验。这也太疯狂了。

Riley用Fable进行精彩实验,效果惊人。