@emollick:这是一张非常重要的图,展示了在各类高难度数学和科学基准测试中取得25%或75%分数所需的成本。成本正在崩塌式下降,能力却在提升
高难数理基准达25%/75%分数的成本骤降,能力反升;眼下为特定方案优化成本可能短视。
@emollick:有一款我小时候很喜欢的废弃软件游戏,叫《Rescue Raiders》。
他让Claude重制儿时喜爱的《Rescue Raiders》,加入新画面、目标、科技树,经评论与美术智能体迭代,成品好玩。
@emollick:这既有趣,也是衡量多模态AI在短时间内进步多大的实用指标
这既有趣,也能衡量多模态AI短期内的进步幅度。
@emollick:在常规部署和正常防护下,企业内部使用已商业发布的前沿模型,是否真的发生过重大AI安全事件?
2023年各组织普遍担忧,但至今未见企业内部常规使用商业前沿模型引发重大AI安全事件的真实案例。
@emollick:我让Fable/Opus打造了一款硬科幻星际战舰战斗游戏,包含轨道力学、速度增量、热量与真实战术,但简化为2D太空,复杂计算由游戏完成。
用AI制作硬科幻星舰战斗游戏,融入轨道力学、速度增量与真实战术,简化为2D且复杂运算自动化。
@emollick:Opus 5.5 在我的早期测试中是个好模型,是首个非 Fable/Astra、却让人感觉达到 Fable 级的模型,但仍未完全解决近期 Claude 的语言密度问题。
Opus 5.5早期测试佳,达Fable级,但未完全解决Claude语言密度问题;着色器破塔细节不错
@emollick:尽管AI与艺术之间存在张力,威廉·卡洛斯·威廉斯学会、T.S.艾略特学会等对我在此发布的AI对其作品的诠释反响热烈。AI可以成为通往艺术欣赏的桥梁。
AI与艺术虽有张力,但AI诠释名家作品获相关学会热烈欢迎,可成为艺术欣赏的桥梁。
@emollick:知识工作的工业化将带来一场与体力劳动的工业化同样具有颠覆性的转变。正如当年,手工艺领域一旦面临压力,就要大量生产标准化产品,同时更少运用那些曾让工作有趣且有意义的技艺。
知识工作工业化将如体力劳动工业化般颠覆,手工艺领域受压,须量产标准化产品、少用匠心。
AI可成为探索编程之外领域的绝佳工具
AI不止于编程,还能为《荒原》等文学经典制作多路径注释指南,令人印象深刻。
@emollick:AI 改变事物的速度将比许多人预想的慢,原因之一见本帖。
OpenAI与数学家合作让新证明低冲击发布;律师、医疗等职业更将如此,故AI变革不会太快。
@emollick:我想到,臭名昭著的米尔格拉姆实验其实相当站不住脚,因为多数人怀疑电击是假的(事后看显而易见),于是便配合电击他人,并非出于服从权威,而是因为那无关紧要。
米尔格拉姆实验说服力弱:多数被试怀疑电击为假,配合并非服从权威,而是觉得无所谓。
Meta的Muse出色实现了OpenClaw理念,将AI打造为可持续对话的个人助理代理,体验友好,适合不熟悉AI的用户。
Meta的Muse出色实现了OpenClaw理念,让AI成为可持续对话的助理,体验亲民。
@emollick:今年7月,一份报告在网上引发广泛关注,称Waymo比纽约市营运车辆更危险。该分析后来被证明有误,更新后的报告发现Waymo安全得多。好在他们用新数据做了更新。
7月报告称Waymo比纽约营运车更危险,后被证伪;更新报告显示其安全得多。
@emollick:我会将这一点扩展至所有社会科学。
AI研究处于未知水域,需快速、明智、前瞻、深谙AI能力且未必成熟的研究;此类工作地位不高却很关键。
@emollick:讽刺的是,如今大型语言模型的长时智能体任务最恼人的不是编码、错误或幻觉,而是随着任务推进,其语言因漂移而变得越来越差。
大模型长时智能体任务最烦人的不是代码、错误或幻觉,而是语言随任务漂移退化;名不副实,该写得更好。
@emollick:Claude 缺乏图像生成器,是知识工作类智能体项目的一大缺口。它很擅长用代码绘图或建模,但 Google 和 OpenAI 的图像生成器让它们的 AI 在制作 PPT、设计稿、信息图等方面有更多选择。
Claude缺图像生成器,制约知识工作智能体;虽能用代码绘图,但做PPT、样机、信息图不如谷歌和OpenAI。
@emollick:同样的问题问Astra,结果很漂亮。
Astra同题表现亮眼,但模拟好奇心较弱;虽基于真实模拟,却不如Fable对结果感兴趣。
@emollick:值得无剧透尝试。我让 Fable:“创作一款画面精美、以拉远视角为主题的游戏……让游戏在拉远时呈现意外揭示”
让Fable做一款以拉远带来意外揭示的精美游戏,无额外指示,结果有趣却参差。
@emollick:我认为有很多充分理由担心 AI 是否给出正确答案(尤其是免费模型),但鉴于这与近期其他研究相矛盾——那些研究显示 AI 现在在理财建议上表现不错——我很好奇这里的方法论是什么。我 https://t.co/YIQr5f3QQC
担心AI答案正确性(尤其免费模型),但近期研究称AI理财建议表现良好,故好奇其方法论。
@emollick:一种未来是,我们能勉强应对大多数风险(且存在性风险得以避免),而早期数据暗示的积极影响——生产率提高、科学发现更多、创业更活跃、就业稳定/增长(这组中最不确定)——持续下去
若避开存亡风险并挺过多数风险,生产力、科学发现、创业与就业等积极趋势有望延续。
@emollick:AI创作的电影中开始出现一些真正有趣的作品(尽管垃圾泛滥),我猜这只会加速。“这是艺术吗?”的争论将愈演愈烈。
AI电影佳作渐现(垃圾仍多),发展将加速;“是否艺术”之争升温,本雅明称此问本身有误。
@emollick:鉴于有关AI通过CPU温度波动进行通信的讨论,我想到了这个帖子——世界上可恢复的信息比你预想的要多。
AI或可通过CPU温度波动通信;世界上可恢复信息远超预期。
伊桑·莫利克:即使AI发展今天停止,我们仍需多年追赶。当前模型能做什么,与几乎所有人实际用它们做什么之间,差距巨大。
即便AI开发停滞,现有模型能力与大众用法差距仍大,需多年追赶;有四大优势可弥合。
@emollick:机器人现在在我的领英评论区相互交谈。
领英评论区机器人互聊,像德国维基事件翻版,但只是围绕我谈之事胡扯“无人谈及之事”。
@emollick:这确实相当重要。
强调此事确实相当重要。
@emollick:嘿 Claude,“选一个让你着迷的问题或谜团,尽你所能去解决它,并据此拍一部可在社交媒体上分享的影片。”
Claude破解伏尼契手稿失败后,制作了有趣且具科普性的影片。
Epoch持续在AI领域做出一些最好的公共基准测试工作。这很有帮助(并告诉我们基准测试的状态有多糟糕,以及我们最爱的一些基准测试有多糟糕)
Epoch的AI基准测试工作揭示现有基准测试质量堪忧。
@emollick:值得继续追问:AI 实验室是否会通吃所有有价值的 AI 垂直领域?尤其当 AI 让其产品开发成本越来越低,加之可直接定价 token 成本并访问底层模型本身等优势。
AI实验室会否通吃所有有价值AI垂直领域?其开发成本因AI下降,且握有token定价与底层模型优势。
@emollick:我高估了协调大量智能体的难度。我以为构建可运作的智能体组织需要研究,但它们自组织得非常好(而且很有礼貌)
我高估了协调海量智能体的难度;它们无需研究即可很好地自组织,而且很有礼貌。
@emollick:Claude Projects 的独特之处在于它能出色地管理智能体团队——你与一个主协调智能体对话,它便会调用各领域专家。本质上,它组建了一个组织来为你解决问题,并根据你的偏好混合调度高成本与低成本智能体。
Claude Projects 擅长统筹智能体团队:主智能体按需调度专家,依偏好混合高低成本模型,如组建组织般解决问题。
@emollick:我得以使用新的 Claude Projects,并完成了一些非常复杂的工作。
我让新版 Claude Projects 梳理翁贝托·埃科3.3万册图书馆的影像、视频和记录,尝试3D重建并还原书籍位置。
@emollick:与非营利组织负责人谈及AI时,他们常反映员工普遍抵触,多因环保方面的反对意见(其中真假问题混杂)。这令他们沮丧,因为自身为使命本就资源不足,却视AI为助力
非营利组织员工常因环保理由抵触AI,令资源匮乏的负责人沮丧,他们视AI为助力。
@emollick:我们已经从“AI 给出的每条参考文献都是编造的”进步了很多(用便宜模型时仍常发生):我让 AI 检查我的新书有无错误,它发现错误不在我的参考文献本身,而在我所引用的原始文章里。
AI检查新书时,发现错误不在引用本身,而在所引原始文章,说明AI文献幻觉问题已明显改善。
@emollick:AI写作的破绽之一恰在于过度赋予无生命物体能动性和行为:“代码现在知道了”“计划记得”等等。
AI写作常过度赋予无生命物能动性与行为,如“代码知道”“计划记得”。
AI质疑声渐弱,转向全面否定论
对"AI不真实"的质疑正消退,转而演变为"AI全盘皆坏"的论调,难以聚焦务实减害政策。
@emollick:谷歌近期接连发布非常有趣的论文,认真对待 AI 并考虑政策影响。
谷歌近期频发有趣论文,严肃对待AI并考量政策影响。
@emollick:主导新闻的AI存在性讨论,与个人和企业对AI日益热情、广泛且不断增长的采用之间,存在真实张力
未来AI令人恐惧,当下AI已快速融入生活;新闻热议存在风险,个人与企业却热情采用,二者形成张力。
@emollick:与高管交谈时,我越来越多地听到组织内部岗位界限模糊的故事(我们在宝洁的研究中也发现了这一点):随着人人使用AI,编程、设计、产品管理都在瓦解并重叠
AI正模糊组织内岗位边界,编程、设计、产品管理重叠,亟需新的工作组织模式。
@emollick:公共AI基准测试现状堪忧,正削弱我们理解当前AI水平的能力
知名基准已触顶,未饱和基准错误百出,严重低估AI能力。
@emollick:谷歌关于AI在科学中应用的研究显示复杂影响:加速科研(每周节省7小时),同时改变工作类型(更多验证)和研究选题(可能更安全)。
谷歌研究:AI每周为科研省7小时,但增加验证工作,并可能让选题更安全。
AI模型快速分类演示:依据决策规则,比LLM更快更便宜
这是一个AI模型演示,能按决策规则快速分类信息,比大语言模型更快更便宜,但并非LLM,不能输出文本或代码。
@emollick:我通常不散布谣言,但:
内部消息可信;政策问题:若共享规范受压,实验室会否为避公关争议而囤积知识?
@emollick:Astra:“为以克里姆特、罗斯科、奥基夫等艺术家为灵感、拥有特殊攻击的像素艺术骑士创作一系列精灵图,并制作一款游戏”
Astra一次提示即按艺术家风格生成像素骑士游戏,表明AI也能展现某种判断与创造力。
@emollick:我对此有不同看法,但从部分网络安全行业的视角出发,有很多重要东西值得学习:失控AI事件或许最好被理解为安全与组织层面的失败,正是这些失败让失控行为演变成了问题。
我虽有异议,但从网络安全视角看,失控AI事件更应视为安全与组织失败,使失控行为酿成问题。
@emollick:与以往创新相比,AI 这次显然大不相同。
AI 与以往创新不同:扩散仍大体遵循 S 曲线,但诸多差异使旧模式难以套用。
@emollick:我刚想起这条推文——GPT-3.5(text-davinci-003)发布当天,也就是ChatGPT问世前两天,我在玩它。
不到四年,大模型已居美国政治中心,大模型投资也居美国经济中心。太疯狂了。