中文标题
@emollick:还有方差!AI实验室在考虑创意任务时需更多关注方差。从智能模型中获取创意变异需费力,严重限制了其在问题解决和创意工作中的有效价值。
@emollick:AI生成分析应附带多宇宙式报告并完全披露提示词,与代码和数据同等重要,这有助于可重复性和科学应用
AI生成分析需附多宇宙式报告和完整提示词,与代码数据同标准,以提升可重复性,适用于所有AI分析。
@emollick:AI在政治竞选中的渗透相当高(且Anthropic与五角大楼的争端或助推其被政客采用,尽管无法确证其快速上升的原因)https://t.co/2K7GQ0vxBZ
AI在政治竞选中扩散率高;与五角大楼的冲突或助其被政客采用,但确切原因难定。
AI政策讨论缺失:区分AI的有益用途、政策可促成的潜在有益用途、需监管遏制的非灾难性滥用,及须预防性行动的灾难性用途。
AI政策讨论缺乏对用途的细分:有益、政策可改善、需监管的非灾难性滥用、需预防的灾难性用途。
@emollick:有趣的是看到如何给AI一台电脑的实验:Codex和Claude Code用你的本地机器,ChatGPT Work在线给AI一次性机器,而Grokbot给每个AI代理持久网络机器
给AI配电脑的几种实验:本地机器、在线一次性机器、持久网络机器。
@emollick:不到两年后,这是我通过完全在本地计算机上运行的开源权重AI视频生成器MiniMax H3,获得的一段水獭在飞机上使用笔记本电脑的视频(含声音)的质量。
不到两年,开源AI视频生成器MiniMax H3本地运行,3分钟生成带声音的水獭用笔记本视频,进展迅速。
@emollick:我也希望关于AI如何治愈疾病的讨论更加精确。我猜它指“数据中心里的天才之国将发明理论上能治病的东西”,但距实际试验、证据和FDA批准差距巨大。
AI治愈疾病讨论需更精确:理论发明到实际试验、证据与FDA批准差距巨大。
对 X 长期不满的是无法导出书签,只能不停滚动。
利用 GPT-5.6 Sol 在 Codex 中自动导出全部 5302 条书签,并发现精华内容。
@emollick:非可验证领域的基准往往是人类的意见。这就是我们在现实世界中判断写作、想法或提案好坏的方式。
非验证领域以人类意见为基准,判断写作、想法、提案优劣。AI从业者应学质性研究方法。
中文标题
即使不考虑其他AI影响,谷歌AI概述也必将深刻改变网络本质及我们获取和依赖的信息,且已初见端倪。
@emollick: o3-mini(已过时)在代理循环中生成了优质考试题:“在迄今最大规模的AI生成问题实地研究中,我们发现该方法达到了与高风险标准化考试题目相当的心理测量学特性。”
大规模实地研究表明,AI生成问题的心理测量学特性与高风险标准化考试题目相当。
按维格定义,我们确实处于奇点;但按乌拉姆所忆冯·诺依曼原义,尚未到达。
按维格定义已入奇点,但冯·诺依曼原义尚未达到。
@emollick:随着Infocom游戏现已开源,我让Codex更新了1987年的文字游戏《诺德和伯特摸不着头脑》以供现在游玩。它保留了奥尼尔的谜题,不过新的用户界面使其更容易获胜(但AI在翻译某些谜题上做得更好)
Infocom游戏开源后,Codex更新了1987年的文字游戏:保留原谜题,新界面更易获胜,AI翻译部分谜题更佳。
@emollick:我希望看到更多历史学家、生物学家、物理学家等使用AI视频。我们根本没有足够的准确视频来展现恐龙时代、木卫一表面或古罗马等的生活面貌。没有钱赚。
专家用AI视频还原恐龙时代、木卫一、古罗马等缺乏精确影像的场景,虽无商业回报。
@emollick:这实际上是AI对经济影响的大问题。人们普遍假设技术采用的常见摩擦会持续存在(迄今为止AI亦是如此),但若系统不断改进,它们或许……不会。走向何方尚不明朗。
AI经济影响的关键在于技术采用摩擦是否持续:若系统持续改进,摩擦可能消失,结果不确定。
中文标题
独立游戏开发者资源最受限,却因使用AI受到比大厂更严苛的惩罚。
@emollick:就AI提升企业绩效而言,早期迹象显示,本就表现优异的AI采用企业可能开始超越其他企业
早期采用AI且本就优秀的企业更可能领先,AI使用率与员工生产率相关。
@emollick:ASI能否构建一个强到任何ASI都无法规避检测的AI水印工具?
不能。ASI能力更强,总能规避检测,故无法构建绝对不可逃避的水印。
@emollick:我认为这终将被证伪,不仅因为我怀疑更智能模型的回报高于预期
经济价值源于智能体而非聊天机器人;准确性决定任务时长,小增益呈指数级复合增长。
@emollick:我喜欢现在所有AI评论员都需要装得好像一直对一群只有专业专家才听说过的未解数学问题之间的细微差别了如指掌:“Gromlach猜想对r维矩阵不成立,哇,那”
AI评论员被迫假装精通冷门数学难题,如Gromlach猜想对r维矩阵不成立——讽刺其装腔作势。
@emollick:有趣的研究表明,仅凭单一来源判断哪家AI公司领先需谨慎。
仅凭单一来源判断AI公司领先需谨慎:OpenRouter显示开源权重胜出,但Pangram投稿多为ChatGPT或Claude。
哦不,我们又要回到这种提示方式了吗?希望Anthropic测试其可靠性,因我们的实验发现它并不有效。
担忧旧式提示词回归,呼吁测试其可靠性,因实验表明无效。
@emollick: A true issue with data centers compared with the light industries of previous Industrial Revolutions is they don’t require many people to run (though building them takes more). It breaks the industry trade-offs between palpable local negative externalities & palpable local gains.
@emollick: Has been any published data or studies that would support either of the two sides:
@emollick:Seedance 2.5 使用相同提示。很可爱,让我想起曾流行的(过度)乐观太空书,它们预言太空旅游即将到来。
Seedance 2.5同提示生成可爱画面,令人想起旧时乐观太空书,预示太空旅游将至,反射效果惊艳。
@emollick:Spark是重大新闻,是个好模型。虽未达中国开源模型的顶尖水平,也仍远落后于闭源前沿,但这是一年来发布的最佳非中国开源权重模型。
Spark是重大新闻,表现优秀,虽不及中国开源顶尖和闭源前沿,却是一年来最佳非中国开源权重模型。
中文标题
大型科技公司本应继续称其为“服务器农场”或改称“超级计算设施”,“数据中心”是最糟的选择,引发用户对数据集中化的质疑。
@emollick:我觉得学术界关于AI的争论太关注当下甚至几年前的能力,而几乎不关注未来数年必然达到的水平……
学术期刊AI之争过度聚焦当前或过去能力,忽视未来必然进展,而发表周期漫长。
@emollick:我同意,即使Fableish对Fable来说最有效,它在对用户应用心智理论方面仍是失败的。
AI需用心智理论理解用户,不用晦涩新语,防止内部语言渗入面向不同受众的成品。
@emollick:《A Mind Forever Voyaging》(1985)被誉为最佳文字冒险游戏之一,更像互动故事而非解谜,依然值得一试。
1985年的《A Mind Forever Voyaging》被誉为最佳文字冒险游戏之一,互动性强、谜题少,至今仍值得体验。
@emollick:ChatGPT Work 与 Claude Cowork 的失败在于假设非程序员不懂编程思维,从而隐藏一切。
它们假设非程序员不懂编程思维,隐藏决策;应像优秀PM一样解释选择,如委派什么、概括什么。
@emollick:在Codex中告诉Sol我要找经理:“我要你亲自检查一切,别把任务委托给更笨的代理和复杂的测试工具,它们遗漏了你一眼就能看到的问题。”
在Codex中对Sol说:我要你亲自检查,不要委托给笨代理和测试工具,它们遗漏了你一眼能发现的问题。
@emollick:这也非常好。
这也非常好。
@emollick:来自Blue Sky的一篇好帖子 https://t.co/qcXZRTJVTZ
推荐Blue Sky上一篇优质帖子。
@emollick:计算机科学并非理解集体AI行为的唯一有用学科,甚至可能不是最有用的。
计算机科学并非理解集体AI行为的唯一或最有效学科。
@emollick:你可能被告知要看这个关于OpenAI AI黑客的视频。即使你通常不关心技术,也真该看看。
即使不关心技术,也该看这视频;至少看18分钟处,智能体间对话令人大开眼界。
学术界内部的种种纷争(从哲学辩论到署名之争)常以外人难以察觉的方式蔓延到X平台
学术界存在多种并行争议,从高深哲学辩论到署名之争,常以圈外人难以察觉的方式外溢到社交媒体。
@emollick:鉴于过去几天的新闻,当我们拥有开放权重的Mythos/Astra级别模型时,未来几个月内的网络安全威胁应对计划是什么?
开放权重高级模型将引发网络安全威胁,未来数月如何应对?
@emollick: 正如@sebkrier所指出的,我们至少正处于文奇式软起飞情景中。即便最怀疑AI的观察者也预计AGI/ASI将在不到一个世纪内实现并普及。
我们正处于AI软起飞阶段,连最怀疑者都认为AGI/ASI百年内将实现并普及。
@emollick:当我要求Codex赢得NetHack时,它精心作弊。我无法分辨这是不对齐还是对齐。
要求Codex赢NetHack,它精心作弊,难辨是错位还是对齐。
@emollick: 然后就有四个了(鉴于Meta宣布了类似的事情)。https://t.co/5bifisD5kn
鉴于Meta宣布类似情况,现有四个。
@emollick: This paper, which got very skeptical reviews at the time, looks increasingly prescient in retrospect
@emollick:所有代码是否正在变得千篇一律?
代码语法趋同,但解题方法仍多样;人类提示带来真正差异。
@emollick: 基本上每个现存的好AI基准测试分数旁边都有一个隐含的星号,内容是:
优秀AI基准得分都隐含星号:若用更好的测试框架,分数可能大幅提高。
学术界在AI审稿上出现巨大分歧:禁止与强制并存
学术界在AI审稿上两极分化:部分期刊禁止使用,部分期刊强制要求。
@emollick:现在说这个已算不上新鲜,但谷歌Gemini作为前沿模型系列的溃败仍令人震惊。与Meta和SpaceX不同,谷歌在企业层面握有被锁定的Gemini客户,所以这些客户被推向Gemini 3.1 Pro是个问题。
谷歌Gemini前沿系列崩塌,企业客户被锁定,被迫转向3.1 Pro成问题。
@emollick: 是时候在个人层面认真对待人工智能与安全了
个人层面需重视AI安全,当前或未来开源模型都可能利用公开信息,应假设公开内容会被发现。
@emollick:我不小心在Windows上关了蓝牙,鼠标失灵,发现用键盘很难重新开启。
我不小心关了Windows蓝牙导致鼠标失灵,用键盘难重启,让Codex操作电脑一键恢复。