@emollick:有趣的是,当我用中文请求Kimi K3挑选两首适用于LLM的非陈腐诗歌时,其思维链中95.5%的字符(88%的词汇)是英文,即便它明确在为中文读者考虑中文诗歌。
中文请求Kimi K3选诗,思维链95.5%字符为英文。
@emollick: 为何如此多最富洞察力的AI实验室观察者齐聚一堂,反而有损AI的公众讨论
AI实验室聚集大量洞察者,反而不利于公众讨论。
@emollick:Kimi K3,如同Claude,钟情于沉没城市、古代末日及垂死巨神。
Kimi K3与Claude一样,偏爱水没古城、远古灾变和垂死巨神。
@emollick: 用Codex控制电脑太棒了:“我从没用过Blender,直接通过电脑操控下载安装,然后用它制作一只3D水獭,并做成小动画。”
仅需一次点击,Codex自动下载安装Blender并制作3D水獭动画。
@emollick:我对“若开放权重最终主导,将导致AI崩溃”的观点感到困惑。如果实验室输了(目前并未发生),并非因为AI无用:计算仍是瓶颈,计算提供商将攫取价值而非实验室。
开放权重主导不会导致AI崩溃,计算仍是瓶颈,价值会被计算提供商捕获。
中文标题
@emollick:这很有趣,但我同样好奇。美英认为闭源实验室发布的模型有真实网络风险,而中国似乎不认同。
移植游戏黄金时代来临,iPad终于有望迎来好游戏?
移植黄金时代已至,iPad或终获优质游戏。
@emollick:我正在关注英国政府AI安全机构的一个基准测试,他们将在几周后权重发布时测试Kimi K3
英国AI安全机构将测试Kimi K3,以评估其是否赶上公开前沿,并引发大量网络讨论
@emollick:中国开源权重模型现在非常优秀,我越来越好奇它们成长为巨头且有价值企业后的竞争动态。竞争激烈:K3优于GLM-5.2,而GLM-5.2又击败了DeepSeek v4等等。它们能否都留在赛道上?
中国开源模型竞争激烈,K3胜GLM-5.2,GLM-5.2胜DeepSeek v4,但能否全部存活?
@emollick: 基于饱和基准和ELO仓促评判Kimi K3,AI前沿令落后数月的模型仍看似未来
基于饱和基准和ELO而非真正难题仓促评判Kimi K3,AI进步让落后模型仍被视作未来。
@emollick: Kimi K3 is a very good model, but people are overindexing on an Arena score again (remember Llama 4?)
基于GPT-4的助手帮助巴基斯坦法官提升6%办案量,且质量不变
GPT-4助手使巴基斯坦法官办案量增6%,质量稳定。
@emollick: Kimi K3写不出好的谋杀悬疑小说(其他模型也不行),这依然是最大的难关
模型写谋杀悬疑时既太直白又太隐晦,无法有效铺垫,这是AI最难突破的领域。
@emollick: 所以我想是时候思考了:开放权重模型的预审核机制是如何运作的?Kimi K3 尚未发布模型卡,但可能几周后权重发布时会有。然而,开放模型很容易被越狱。那些声称达到Mythos/Sol级别的开放模型(K3尚未达到,但...)
开放权重模型预审核机制不明,易被越狱,即使声称高级别也存风险。
@emollick:警示:Kimi K3 Max在审计学术工作时出现多种错误,包括误用统计方法。
Kimi K3 Max处理统计审计时犯多种错误,如误用统计方法,需警惕。
@emollick: 我假设谷歌能避开这个陷阱,但Meta的Llama 4和xAI的Grok 4之后的情况正是如此。唯一未因“下一代大模型令人失望陷阱”而严重挫伤领先地位的公司是OpenAI,凭借Orion/GPT-4.5。
仅OpenAI以Orion/GPT-4.5逃脱下一代大模型令人失望的陷阱,未失领先地位。
@emollick:Kimi K3之后,开源模型再次逼近前沿,我好奇Anthropic和OpenAI是否会被政府允许加快发布节奏。Mythos于四月份发布(早于Opus 4.7),这意味着Fable 5已算“老”模型了。
开源模型逼近前沿,政府或限制大模型发布节奏,Fable 5已成旧模型。
@emollick:我让AI一次性程序化生成历史港口城镇的基准测试,现包含GPT-5.6 Pro、Fable、Kimi K3和Inkling,所有模拟可互动体验
AI一次性生成历史港口城镇基准测试,新增多个模型,可互动模拟。
@emollick:前端极致化将成为新的谄媚之道:让模型在网上获得大量喜爱的最简单方法是构建漂亮网页、精美SVG和绝佳3js世界,比后端代码或复杂分析更易于分享
前端极致化成为新谄媚:做漂亮网页、SVG及3D场景,比后端更易分享获赞。
@emollick:Kimi K3在我着色器测试中的表现:"创建一个视觉有趣的着色器,可在twigl-dot-app中运行,使其看起来像一座由新哥特式塔楼组成的无限城市,部分淹没在风暴海洋中,有大浪。""让它更好"
Kimi K3成功生成视觉有趣的着色器,创建新哥特式塔楼无限城与风暴海洋场景,模型优秀但非顶尖。
中文标题
Kimi K3表现接近前沿,但模型/框架会反复循环调整任务,示例即将发布。
意外获赠代币有趣,但规划支出如赌博令人不适
收到意外代币有趣,但规划支出像赌博一样奇怪。
@emollick: 很高兴看到新开放权重模型,但Inkling测试表现粗糙,远不及中国前沿模型
新模型Inkling测试表现差,未通过Lem测试,不如中国前沿模型。
@emollick: 非常反感“前端”一词被用来笼统概括AI中所有涉及品味、判断和设计的部分。后端软件有大量细分,前端却常常只是杂烩一堆。
厌恶“前端”一词笼统概括AI品味设计,后端有细分,前端却是杂烩。
@emollick:我早在诺兰之前就发布了《奥德赛》的最终版
早于诺兰推出《奥德赛》终极版
@emollick: I demonstrated the incredible power of o1-preview/ reasoning less than two years ago by showing it could solve this crossword puzzle with only one hint. https://t.co/FPe4J4xqLu
@emollick: 我想用Stream Deck控制Codex。让GPT-5.6 Pro根据规格写项目计划,Codex执行。为免繁琐点击,Codex接管电脑自动安装。
用GPT生成计划,Codex自动接管电脑安装软件,要软件比找软件更快。
@emollick: 有趣的是,等上30分钟却感觉像等了几周的工作。真的需要将放置点击游戏集成到Codex中,让我们在等待输出时有事可做。
等待30分钟似几周漫长,提议在Codex中集成放置游戏消磨时间。
@emollick: 读了份流行“反低质”Agent MD文件,发现100% AI写就,实际会超虚构你的输出成超级低质
所谓“反低质”AI文件实为AI编写,反而通过超虚构产生超级低质输出。
@emollick: 寓言:把奥德修斯包装成管理顾问,声称他找到了产品市场契合点,应坚持制作特洛伊木马,而非用PPT论证返回伊萨卡
管理咨询讽刺:奥德修斯被建议专注木马产品而非回家,卡珊德拉差评“0/10000读者认为有用”
@emollick: 有趣的是,我居然上榜了!
我上了这个名单,而且是唯一没有活跃社交账号的人。
@emollick: Codex 现在能制作完整PPT,但默认演示技能让我头疼
Codex可生成完整PPT,但默认模板通用且含大量工具信息,难修改。
@emollick: iOS ChatGPT应用远程控制电脑功能很棒,但设置说明与桌面菜单不匹配
iOS ChatGPT远程功能好用,但设置说明与桌面菜单不符,文档过时。
@emollick: 如果你使用Claude全能应用,你会在Home和Code之间选择。选择Home后,你还可以在Chat和Cowork之间选择。
Claude应用Home下可选Chat或Cowork,OpenAI应用选Work或Codex,Chat在侧菜单,网站版不同。
@emollick:AI既是被无限推测的对象,又作为写手大规模生成推测,这是评论文章的黄金时代
AI同时作为猜想对象和生成工具,开启评论文章黄金时代。
@emollick:你研究过The Weights吗?https://t.co/RG6Wu6ZShD
@emollick 提问是否研究过The Weights,并附链接。
@emollick: 这太不可思议了:我让Fable制作了一个《伊利亚特》船舶名录网站,之前我用GPT-4做过同样的事。它做得非常漂亮。
Fable制作《伊利亚特》船舶名录网站,还指出Butler英译本中的两处希腊语翻译错误。
@emollick: 令我惊讶的是,完全多模态(任意对任意)模型并未引起更大轰动。似乎只有谷歌实验室在发布这类模型,OpenAI使用选择性多模态能力,Anthropic则以无多模态输出闻名,而开源权重模型则参差不齐。
完全多模态模型未成主流,仅谷歌积极发布,OpenAI有限,Anthropic缺失,开源模型参差不齐。
@emollick:我认为在智能体工具盛行的世界里,OpenRouter并不能很好地衡量实际模型使用情况(并非怀疑中国开源模型使用量在上升,但这看起来也可能是一张使用量向Codex/Code/Cowork转移的图表)
OpenRouter无法准确衡量模型实际使用,使用量可能转向了Codex等工具。
@emollick: Codex 的计算机使用能力在 PC 上变得非常出色。让它在电脑上执行任务,看着光标像被幽灵操控般移动,会让你切身感受到无实体智能仅凭鼠标键盘能完成多少工作。
Codex的PC操控能力极强,光标如幽灵移动,令人直观感受无实体智能的巨量工作潜力。
@emollick: AI与企业策略的讨论并不复杂:无前沿模型的供应商贬低前沿模型公司,而有前沿模型的供应商则推销基于前沿模型的方案。
AI企业策略:无前沿模型者贬低前沿模型,有前沿模型者推销相关方案,各为其利。
@emollick:AI对工作的影响尚不明确,理解这一影响对制定政策至关重要,数据是行动关键,需立即开始收集
AI工作影响未知,理解其重要性关乎政策,数据是关键,需立即收集。
@emollick:很少有人知道当前模型在代码/Codex等场景中通过正确设置能做多少有用工作
当前模型在代码场景中通过正确设置能力被低估,源于AI公司未能清晰解释其系统功能。
@emollick: 我一直思考那个著名图表,专家年复一年预测太阳能安装线性增长,却总错在仍指数增长。
专家屡错估太阳能为线性增长,实则指数;类似误判正现于AI产品战略。
@emollick: 如果对未来有更清晰的预期,规划如何使用AI会容易得多。
规划AI使用需有明确预期,哪怕只是临时性说明也比没有好。
@emollick: 我们超越了图表!1969年阿波罗10号以24,816英里/小时创下人类最快速度,这一速度原本预测要到2005年才能实现。
1969年阿波罗10号以24816英里/小时创下人类最快速度,比预测提前36年。
@emollick: 我已放弃解决X平台机器人回复问题的希望,“没人说的部分”写法烦人且观点雷同
X平台机器人回复问题无解,“没说的部分”写法烦人且观点雷同。
@emollick: 谷歌将2%车辆路线改为优先避开拥堵的同等快速路线,全市车速提升且油耗降低
谷歌调整2%车辆路线避开拥堵,全市车速提升、油耗降低。