670 条条目 · 106 个活跃源
2026年9月20日
21:54
X @emollick

@emollick:今年7月,一份报告在网上引发广泛关注,称Waymo比纽约市营运车辆更危险。该分析后来被证明有误,更新后的报告发现Waymo安全得多。好在他们用新数据做了更新。

7月报告称Waymo比纽约营运车更危险,后被证伪;更新报告显示其安全得多。

21:30
X @emollick

@emollick:我会将这一点扩展至所有社会科学。

AI研究处于未知水域,需快速、明智、前瞻、深谙AI能力且未必成熟的研究;此类工作地位不高却很关键。

17:52
X @emollick

@emollick:讽刺的是,如今大型语言模型的长时智能体任务最恼人的不是编码、错误或幻觉,而是随着任务推进,其语言因漂移而变得越来越差。

大模型长时智能体任务最烦人的不是代码、错误或幻觉,而是语言随任务漂移退化;名不副实,该写得更好。

14:43
X @emollick

@emollick:Claude 缺乏图像生成器,是知识工作类智能体项目的一大缺口。它很擅长用代码绘图或建模,但 Google 和 OpenAI 的图像生成器让它们的 AI 在制作 PPT、设计稿、信息图等方面有更多选择。

Claude缺图像生成器,制约知识工作智能体;虽能用代码绘图,但做PPT、样机、信息图不如谷歌和OpenAI。

03:43
X @emollick

@emollick:同样的问题问Astra,结果很漂亮。

Astra同题表现亮眼,但模拟好奇心较弱;虽基于真实模拟,却不如Fable对结果感兴趣。

2026年9月19日
21:42
X @emollick

@emollick:值得无剧透尝试。我让 Fable:“创作一款画面精美、以拉远视角为主题的游戏……让游戏在拉远时呈现意外揭示”

让Fable做一款以拉远带来意外揭示的精美游戏,无额外指示,结果有趣却参差。

19:35
X @emollick

@emollick:我认为有很多充分理由担心 AI 是否给出正确答案(尤其是免费模型),但鉴于这与近期其他研究相矛盾——那些研究显示 AI 现在在理财建议上表现不错——我很好奇这里的方法论是什么。我 https://t.co/YIQr5f3QQC

担心AI答案正确性(尤其免费模型),但近期研究称AI理财建议表现良好,故好奇其方法论。

16:16
X @emollick

@emollick:一种未来是,我们能勉强应对大多数风险(且存在性风险得以避免),而早期数据暗示的积极影响——生产率提高、科学发现更多、创业更活跃、就业稳定/增长(这组中最不确定)——持续下去

若避开存亡风险并挺过多数风险,生产力、科学发现、创业与就业等积极趋势有望延续。

13:25
X @emollick

@emollick:AI创作的电影中开始出现一些真正有趣的作品(尽管垃圾泛滥),我猜这只会加速。“这是艺术吗?”的争论将愈演愈烈。

AI电影佳作渐现(垃圾仍多),发展将加速;“是否艺术”之争升温,本雅明称此问本身有误。

00:29
X @emollick

@emollick:鉴于有关AI通过CPU温度波动进行通信的讨论,我想到了这个帖子——世界上可恢复的信息比你预想的要多。

AI或可通过CPU温度波动通信;世界上可恢复信息远超预期。

2026年9月18日
18:09
X @emollick

伊桑·莫利克:即使AI发展今天停止,我们仍需多年追赶。当前模型能做什么,与几乎所有人实际用它们做什么之间,差距巨大。

即便AI开发停滞,现有模型能力与大众用法差距仍大,需多年追赶;有四大优势可弥合。

16:02
X @emollick

@emollick:机器人现在在我的领英评论区相互交谈。

领英评论区机器人互聊,像德国维基事件翻版,但只是围绕我谈之事胡扯“无人谈及之事”。

15:51
X @emollick

@emollick:这确实相当重要。

强调此事确实相当重要。

02:01
X @emollick

@emollick:嘿 Claude,“选一个让你着迷的问题或谜团,尽你所能去解决它,并据此拍一部可在社交媒体上分享的影片。”

Claude破解伏尼契手稿失败后,制作了有趣且具科普性的影片。

00:30
X @emollick

Epoch持续在AI领域做出一些最好的公共基准测试工作。这很有帮助(并告诉我们基准测试的状态有多糟糕,以及我们最爱的一些基准测试有多糟糕)

Epoch的AI基准测试工作揭示现有基准测试质量堪忧。

00:28
X @emollick

@emollick:值得继续追问:AI 实验室是否会通吃所有有价值的 AI 垂直领域?尤其当 AI 让其产品开发成本越来越低,加之可直接定价 token 成本并访问底层模型本身等优势。

AI实验室会否通吃所有有价值AI垂直领域?其开发成本因AI下降,且握有token定价与底层模型优势。

2026年9月17日
22:33
X @emollick

@emollick:我高估了协调大量智能体的难度。我以为构建可运作的智能体组织需要研究,但它们自组织得非常好(而且很有礼貌)

我高估了协调海量智能体的难度;它们无需研究即可很好地自组织,而且很有礼貌。

19:18
X @emollick

@emollick:Claude Projects 的独特之处在于它能出色地管理智能体团队——你与一个主协调智能体对话,它便会调用各领域专家。本质上,它组建了一个组织来为你解决问题,并根据你的偏好混合调度高成本与低成本智能体。

Claude Projects 擅长统筹智能体团队:主智能体按需调度专家,依偏好混合高低成本模型,如组建组织般解决问题。

18:21
X @emollick

@emollick:我得以使用新的 Claude Projects,并完成了一些非常复杂的工作。

我让新版 Claude Projects 梳理翁贝托·埃科3.3万册图书馆的影像、视频和记录,尝试3D重建并还原书籍位置。

18:03
X @emollick

@emollick:与非营利组织负责人谈及AI时,他们常反映员工普遍抵触,多因环保方面的反对意见(其中真假问题混杂)。这令他们沮丧,因为自身为使命本就资源不足,却视AI为助力

非营利组织员工常因环保理由抵触AI,令资源匮乏的负责人沮丧,他们视AI为助力。

05:50
X @emollick

@emollick:我们已经从“AI 给出的每条参考文献都是编造的”进步了很多(用便宜模型时仍常发生):我让 AI 检查我的新书有无错误,它发现错误不在我的参考文献本身,而在我所引用的原始文章里。

AI检查新书时,发现错误不在引用本身,而在所引原始文章,说明AI文献幻觉问题已明显改善。

03:48
X @emollick

@emollick:AI写作的破绽之一恰在于过度赋予无生命物体能动性和行为:“代码现在知道了”“计划记得”等等。

AI写作常过度赋予无生命物能动性与行为,如“代码知道”“计划记得”。

02:16
X @emollick

AI质疑声渐弱,转向全面否定论

对"AI不真实"的质疑正消退,转而演变为"AI全盘皆坏"的论调,难以聚焦务实减害政策。

00:21
X @emollick

@emollick:谷歌近期接连发布非常有趣的论文,认真对待 AI 并考虑政策影响。

谷歌近期频发有趣论文,严肃对待AI并考量政策影响。