@emollick:嗯?
仅有“嗯?”一声,无实质内容。
@emollick:在大家都聚焦高难数学之时,我们也应建立一个历史谜团与密码库,供模型去攻。我认识一些历史学家(如 https://t.co/CIq2xQpTUy),他们已在用新模型处理古老、未破译的手写记录。
主张除高难数学外,建历史谜题与密码库供模型破解;史学家已用新模型解读未译手稿,并提议试试Linear AI。
@emollick:我觉得,企业的数据主权运动将迎面撞上一个难题:只要 AI 能力持续指数级增长,靠维护微调小模型来不断压过更大的通用模型,既昂贵又困难
企业数据主权运动面临挑战:AI 能力指数增长下,维持微调小模型持续超越通用大模型既昂贵又困难。
@emollick:“不要将终末内在化”本不应被按字面理解,但如果你真的想按字面把终末内在化,这通常也是条好建议。
劝诫“不要将终末内在化”本非字面之语;若你真要字面实现它,这仍是好建议。
GPT-6 Astra与Fable 5.1已足以对大部分经济领域产生变革性影响
GPT-6 Astra与Fable 5.1已足以在多数经济领域产生变革性影响,适当引导可完成数周人类工作,但影响不均且非一蹴而就。
@emollick:我认为,一旦远程连接“你的”Claude、Astra或Claw之类变得更便捷、更普遍,Siri这类手机助手就会大幅贬值。你想要一个能统管一切、洞悉众多系统与偏好的智能AI,而不是一个能力有限的助手。
远程个人AI普及后,Siri等手机助手将大幅贬值;人们需要能统管多系统与偏好的全能AI。
@emollick:我不知道过去几天还会导致什么其他后果,但我可以肯定地说,许多原本不太关注AI的人,现在正因AI会杀死所有人而惊恐万分。
过去几天让许多原本不关注AI的人开始恐惧AI会杀死所有人。
@emollick:存在性风险显然至关重要,但它并非唯一需要政策应对的AI议题
担心存在性风险成唯一焦点;AI无需更强模型即可广泛影响就业与社会,需提前准备促好结果、缓负面。
AI越来越强的一个弊端:越来越难展示其优缺点
AI愈发强大,反难以展示其优劣。虽能写出好论文,却仍不及人类,需懂行才知缘由。
@emollick: METR is rapidly becoming a de facto industry standard-making body for AI
@emollick: It is often startling to move back and forth between the world of organizations and the world of cutting-edge AI. Organizations underestimate AI ability growth (often by a lot) and the AI tech world underestimates AIs real world jaggedness (often by a lot)
@emollick: As always, statements on X are a mixed bag and I have no secret knowledge to draw on, but if Google is able to return to the frontier on AI, it would definitely change the current AI dynamic, as it is a large, public, regulated entity with different goals than Anthropic or OAI.
@emollick: So here is Astra's attempt to make an Ultima-style RPG game using feedback from agents to improve, etc.
@emollick: This week brought some of the clearest statements we've heard from both Anthropic & OpenAI that some form of recursive self-improvement has been achieved, though it still sounds early
@emollick: Now that METR long horizons is effectively saturated (Epoch found pre-Fable agents could do 18 weeks of human work), what is the best quantitative graph that shows the current exponential progress curve?
@emollick: Here's a automated forecasting system to estimate catastrophic risk from some major experts on forecasting.
@emollick: No matter how much you are hearing about AI, today is the least you will ever hear about AI.
@emollick: Astra's turn: "Make a game about Imminence. Something very big, very strange is happening. A suburb & the arrival of a vast & unknowable presence. Not horror, invoke the feeling of the end of all things coming, inevitably, but also not sad or scary"
@emollick:草莓事件很有趣,但可能让人对 AI 在数学领域的发展方向产生错误印象。
草莓梗虽好笑,却可能让人误判 AI 在数学领域的发展方向。
@emollick:你在数学领域当前看到的现象,是“锯齿状前沿”的结果,也是其他职业未来将发生之事的先兆。的确,数学家会做数学,但他们也有自己视为重要的其他任务(指导学生、维护科学共同体、守护……
数学现状是AI“锯齿状前沿”的结果,预示其他职业未来;数学家还需指导学生、维护学术共同体。
@emollick:在 Codex 和 Code 中成功使用智能体的关键因素,是决定何时以及如何选用这些选项。
关键在决定何时、如何选用选项;若不引导长期智能体任务,说明管理不足,需建阶段性报告保持可见。
即使AI发展今日停滞,现有模型仍将带来至少十年的职场、教育和社会生活剧变
即便AI即刻停步,现有模型仍将推动职场、教育与社会至少十年的剧烈变革。
@emollick:我正用 AI 在众多我不想或无需擅长的烦人任务上飞速自我去技能化,怎么去技能化都不够快。
借助AI,我迅速让自己在诸多不想或不需擅长的烦人任务上去技能化,还嫌不够快。
中文标题
谷歌失去前沿模型,错失两大贡献机会:数学突破(需算力与科学积淀)和网络安全(需大公司视角)。
@emollick:快速浏览之下,这里似乎大有文章。
快速阅读即发现内容复杂丰富,信息量较大。
@emollick:开放权重模型与前沿的差距比近期所见更大。Mythos三月份推出,此后虽有K3和GLM-5.3等优秀开源模型,但实际表现仍不及Mythos或Astra。预计情况会改变。
开放权重模型与顶尖模型差距明显,Mythos三月发布后,K3和GLM-5.3虽好仍逊一筹,预计未来会改进。
@emollick:我一直在思考关于“等待计算”的问题。尤其在数学和生物学领域,开发中的模型很可能在难题上取得重大进展(无论是否有人类协助)
思考“等待计算”:数学和生物学领域,开发中的模型很可能独立攻克难题,取得重大进展。
人工智能如何改变任务组合,以及不同假设下GDP增长的交互式模拟,可视化效果出色。
若GDP爆炸性增长与大规模白领失业同时出现,尚缺正确的政策应对方案。
今日实验室人员的讨论异常古怪,即使以AI领域标准看也是如此,这让我觉得大家都在对快速变化的事件——无论是AI能力展现还是公众认知——做出被动反应。
实验室人员讨论反常,反映大家都在被动应对AI能力与公众认知的快速变化。
@emollick:过去两周愈发清晰——公司再怎么担心网络安全也不为过。
WeWorm演示凸显恶意行为者之效;Hugging Face事件则说明,甚至无需恶意行为者也有风险。
@emollick:快,散布一些关于Anthropic即将解决其他真正难题的谣言。
散布Anthropic即将攻克其他真正难题的谣言。
@emollick:AI似乎正在超越最优秀预测者的预期
AI实际表现已优于顶尖预测者的预期,进展速度比人们预想更快。
中文标题:@emollick:无论我们拥有多少算力,未来都越来越可能需要更多算力
算力再多也不够,未来需求只会持续增长。
@emollick:这是件大事。
这是重大事件。学术荣誉归属及证明时间顺序的争议尚待厘清,但这依然是一大进展。
@emollick:弱通用人工智能已实现(至少根据2020年设定的标准),比近期预测提前一年
弱通用人工智能已按2020年标准实现,比近期预测提早一年,多代大模型已通过多个重要基准测试。
@emollick:我成功让一个小型本地模型演奏了《4′33″》
成功让本地小模型演奏约翰·凯奇《4分33秒》的无声乐章。
@emollick:METR_Evals的长期视野指标是否已实际饱和?
自五月以来AI进展关键图表未更新,但其他研究表明Fable在辅助下可完成18周以上工作。
中文标题
中文摘要
@emollick:如果你是学者,不妨把论文丢给GPT-6 Pro并让它“帮我审稿”。它现在擅长发现实质问题、平衡优点并提出补充建议
学者可让GPT-6 Pro审稿,它善于发现实质问题、兼顾论文优点并建议补充。
@emollick:几年后,在GPT-6下
夺心魔似乎有“101骨骨架”;按5E 2014规则未发现大错误,但战术可更有创意。
@emollick:如今,在Claude和ChatGPT中,要追踪你的工作和对话究竟在哪已非常困难:本地电脑?云端?哪台电脑?手机?通过Dispatch或Remote连接的电脑?你在Tag中对话的那台?它在项目里吗?当前的用户体验几乎毫无帮助。
在Claude和ChatGPT中,工作与对话的位置难以追踪:本地、云端、设备、项目,现有界面几乎无助。
@emollick:我认为这并非初衷,但Astra在视觉惊艳的3D作品(如Blender)上极为擅长,使其在社交媒体注意力争夺战中较Fable更具感知优势。其他输出较难评判,但视觉内容一目了然。
Astra擅长视觉3D作品,在社交媒体吸引眼球方面胜过Fable,其他能力难评,视觉优势明显。
@emollick:Transformer问世不足十年。
Transformer问世不足十年;GPT-3.5(ChatGPT)发布不足四年;首个推理模型o1-preview发布不足两年。
@emollick:我承认我们正处于“锯齿状AGI”时代(许多领域强于人类,其他领域逊于人类),但那是AGI吗?若指在多数人类任务上超越人类专家,我们尚未达到(也许?)。
作者认为当前AI是“锯齿状AGI”,并非真正AGI,但其发展之快仍令人惊叹。
@emollick:这既是一个有趣的实验,也是学术界即将迎来海啸的信号。AI回溯阅读研究,发现已发表论文中的机会与问题,并公开分享这些评判。https://t.co/cuspyyIz9z https://t.co/MxRYlaqGiS
人工智能回溯审视已发表论文,发现机遇与问题并公开分享,既是有趣实验,也是学术界海啸前兆。
@emollick:Fable 5.1 一次生成惊艳结果——“基于爱伦·坡打造至少8款游戏,各具特色且品质上乘”
Fable 5.1 依据爱伦·坡一次生成8款游戏,各具特色、好玩且氛围感强,部分甚至有些惊悚。
@emollick:人工智能奖励专业知识(至少目前如此)
专业知识能评估AI输出、快速定位能力边界,并指导改进;非专家往往困于默认结果。
@emollick:鉴于AI输出往往是交互式程序,更多非技术人员需寻找轻量托管服务(我用Netlify,但选择很多)
人工智能输出常为交互程序,非技术人群需轻量托管;现成工具难持久且缺乏控制,自行选用托管更稳妥。