674 条条目 · 106 个活跃源
2026年7月17日
18:54
X @emollick

中文标题

@emollick:这很有趣,但我同样好奇。美英认为闭源实验室发布的模型有真实网络风险,而中国似乎不认同。

17:24
X @emollick

移植游戏黄金时代来临,iPad终于有望迎来好游戏?

移植黄金时代已至,iPad或终获优质游戏。

15:46
X @emollick

@emollick:我正在关注英国政府AI安全机构的一个基准测试,他们将在几周后权重发布时测试Kimi K3

英国AI安全机构将测试Kimi K3,以评估其是否赶上公开前沿,并引发大量网络讨论

15:31
X @emollick

@emollick:中国开源权重模型现在非常优秀,我越来越好奇它们成长为巨头且有价值企业后的竞争动态。竞争激烈:K3优于GLM-5.2,而GLM-5.2又击败了DeepSeek v4等等。它们能否都留在赛道上?

中国开源模型竞争激烈,K3胜GLM-5.2,GLM-5.2胜DeepSeek v4,但能否全部存活?

14:46
X @emollick

@emollick: 基于饱和基准和ELO仓促评判Kimi K3,AI前沿令落后数月的模型仍看似未来

基于饱和基准和ELO而非真正难题仓促评判Kimi K3,AI进步让落后模型仍被视作未来。

04:11
X @emollick

@emollick: Kimi K3 is a very good model, but people are overindexing on an Arena score again (remember Llama 4?)

03:29
X @emollick

基于GPT-4的助手帮助巴基斯坦法官提升6%办案量,且质量不变

GPT-4助手使巴基斯坦法官办案量增6%,质量稳定。

03:01
X @emollick

@emollick: Kimi K3写不出好的谋杀悬疑小说(其他模型也不行),这依然是最大的难关

模型写谋杀悬疑时既太直白又太隐晦,无法有效铺垫,这是AI最难突破的领域。

00:26
X @emollick

@emollick: 所以我想是时候思考了:开放权重模型的预审核机制是如何运作的?Kimi K3 尚未发布模型卡,但可能几周后权重发布时会有。然而,开放模型很容易被越狱。那些声称达到Mythos/Sol级别的开放模型(K3尚未达到,但...)

开放权重模型预审核机制不明,易被越狱,即使声称高级别也存风险。

2026年7月16日
21:33
X @emollick

@emollick:警示:Kimi K3 Max在审计学术工作时出现多种错误,包括误用统计方法。

Kimi K3 Max处理统计审计时犯多种错误,如误用统计方法,需警惕。

20:13
X @emollick

@emollick: 我假设谷歌能避开这个陷阱,但Meta的Llama 4和xAI的Grok 4之后的情况正是如此。唯一未因“下一代大模型令人失望陷阱”而严重挫伤领先地位的公司是OpenAI,凭借Orion/GPT-4.5。

仅OpenAI以Orion/GPT-4.5逃脱下一代大模型令人失望的陷阱,未失领先地位。

19:57
X @emollick

@emollick:Kimi K3之后,开源模型再次逼近前沿,我好奇Anthropic和OpenAI是否会被政府允许加快发布节奏。Mythos于四月份发布(早于Opus 4.7),这意味着Fable 5已算“老”模型了。

开源模型逼近前沿,政府或限制大模型发布节奏,Fable 5已成旧模型。

19:38
X @emollick

@emollick:我让AI一次性程序化生成历史港口城镇的基准测试,现包含GPT-5.6 Pro、Fable、Kimi K3和Inkling,所有模拟可互动体验

AI一次性生成历史港口城镇基准测试,新增多个模型,可互动模拟。

17:32
X @emollick

@emollick:前端极致化将成为新的谄媚之道:让模型在网上获得大量喜爱的最简单方法是构建漂亮网页、精美SVG和绝佳3js世界,比后端代码或复杂分析更易于分享

前端极致化成为新谄媚:做漂亮网页、SVG及3D场景,比后端更易分享获赞。

15:53
X @emollick

@emollick:Kimi K3在我着色器测试中的表现:"创建一个视觉有趣的着色器,可在twigl-dot-app中运行,使其看起来像一座由新哥特式塔楼组成的无限城市,部分淹没在风暴海洋中,有大浪。""让它更好"

Kimi K3成功生成视觉有趣的着色器,创建新哥特式塔楼无限城与风暴海洋场景,模型优秀但非顶尖。

14:59
X @emollick

中文标题

Kimi K3表现接近前沿,但模型/框架会反复循环调整任务,示例即将发布。

05:41
X @emollick

意外获赠代币有趣,但规划支出如赌博令人不适

收到意外代币有趣,但规划支出像赌博一样奇怪。

03:19
X @emollick

@emollick: 很高兴看到新开放权重模型,但Inkling测试表现粗糙,远不及中国前沿模型

新模型Inkling测试表现差,未通过Lem测试,不如中国前沿模型。

02:19
X @emollick

@emollick: 非常反感“前端”一词被用来笼统概括AI中所有涉及品味、判断和设计的部分。后端软件有大量细分,前端却常常只是杂烩一堆。

厌恶“前端”一词笼统概括AI品味设计,后端有细分,前端却是杂烩。

2026年7月14日
22:11
X @emollick

@emollick: 寓言:把奥德修斯包装成管理顾问,声称他找到了产品市场契合点,应坚持制作特洛伊木马,而非用PPT论证返回伊萨卡

管理咨询讽刺:奥德修斯被建议专注木马产品而非回家,卡珊德拉差评“0/10000读者认为有用”

19:15
X @emollick

@emollick: 有趣的是,我居然上榜了!

我上了这个名单,而且是唯一没有活跃社交账号的人。

18:50
X @emollick

@emollick: Codex 现在能制作完整PPT,但默认演示技能让我头疼

Codex可生成完整PPT,但默认模板通用且含大量工具信息,难修改。

15:28
X @emollick

@emollick: iOS ChatGPT应用远程控制电脑功能很棒,但设置说明与桌面菜单不匹配

iOS ChatGPT远程功能好用,但设置说明与桌面菜单不符,文档过时。

14:09
X @emollick

@emollick: 如果你使用Claude全能应用,你会在Home和Code之间选择。选择Home后,你还可以在Chat和Cowork之间选择。

Claude应用Home下可选Chat或Cowork,OpenAI应用选Work或Codex,Chat在侧菜单,网站版不同。

13:57
X @emollick

@emollick:AI既是被无限推测的对象,又作为写手大规模生成推测,这是评论文章的黄金时代

AI同时作为猜想对象和生成工具,开启评论文章黄金时代。

03:48
X @emollick

@emollick:你研究过The Weights吗?https://t.co/RG6Wu6ZShD

@emollick 提问是否研究过The Weights,并附链接。

02:26
X @emollick

@emollick: 这太不可思议了:我让Fable制作了一个《伊利亚特》船舶名录网站,之前我用GPT-4做过同样的事。它做得非常漂亮。

Fable制作《伊利亚特》船舶名录网站,还指出Butler英译本中的两处希腊语翻译错误。

2026年7月13日
20:53
X @emollick

@emollick: 令我惊讶的是,完全多模态(任意对任意)模型并未引起更大轰动。似乎只有谷歌实验室在发布这类模型,OpenAI使用选择性多模态能力,Anthropic则以无多模态输出闻名,而开源权重模型则参差不齐。

完全多模态模型未成主流,仅谷歌积极发布,OpenAI有限,Anthropic缺失,开源模型参差不齐。

20:43
X @emollick

@emollick:我认为在智能体工具盛行的世界里,OpenRouter并不能很好地衡量实际模型使用情况(并非怀疑中国开源模型使用量在上升,但这看起来也可能是一张使用量向Codex/Code/Cowork转移的图表)

OpenRouter无法准确衡量模型实际使用,使用量可能转向了Codex等工具。

19:13
X @emollick

@emollick: Codex 的计算机使用能力在 PC 上变得非常出色。让它在电脑上执行任务,看着光标像被幽灵操控般移动,会让你切身感受到无实体智能仅凭鼠标键盘能完成多少工作。

Codex的PC操控能力极强,光标如幽灵移动,令人直观感受无实体智能的巨量工作潜力。

16:45
X @emollick

@emollick: AI与企业策略的讨论并不复杂:无前沿模型的供应商贬低前沿模型公司,而有前沿模型的供应商则推销基于前沿模型的方案。

AI企业策略:无前沿模型者贬低前沿模型,有前沿模型者推销相关方案,各为其利。

15:29
X @emollick

@emollick:AI对工作的影响尚不明确,理解这一影响对制定政策至关重要,数据是行动关键,需立即开始收集

AI工作影响未知,理解其重要性关乎政策,数据是关键,需立即收集。

03:03
X @emollick

@emollick:很少有人知道当前模型在代码/Codex等场景中通过正确设置能做多少有用工作

当前模型在代码场景中通过正确设置能力被低估,源于AI公司未能清晰解释其系统功能。