@emollick: Gemini Pro模型的迭代速度似乎远不及Claude或GPT(上次发布是2月的3.1 Pro),这导致谷歌与其他两家实验室之间的性能差距越来越大,而Gemini 3.5 Flash模型虽然优秀,但并未大幅缩小这一差距。
Gemini Pro迭代慢于Claude/GPT,性能差距扩大,Flash 3.5未有效弥补。
@emollick:Anthropic这张图表很有用,因为代理团队和工作流都非常新且强大(且消耗大量token)
Anthropic图表表明代理团队和工作流强大但耗令牌,实际中AI常组合运用。
@emollick:中国实验室需持续发布开放权重模型,否则前沿将落后于本地/微调模型使用者
中国实验室若停止发布开放权重模型,前沿领域将落后于本地/微调模型使用者。
@emollick:至少在快速进步停止之前(如果会停止的话),其他人似乎很难追上三大AI实验室
微软和Meta模型平平非前沿,SpaceX未恢复,中国模型进步但仍有差距。
@emollick: 基于与同行的非正式交流,人文学科学者对AI充满热情(同时也担忧其负面影响),但因显而易见的原因,他们通常不在社交媒体上公开观点。
人文学科学者虽对AI热情且担忧其影响,但极少在社交平台公开表态。
@emollick:我认为这篇文章关于Anthropic的RSI非常值得一读
文章虽有自恋和营销,但透露了Anthropic对AI近期发展的真诚信念,值得关注。
@emollick:截至2026年5月,Anthropic代码库合并的代码中超过80%由Claude编写。
截至2026年5月,Anthropic合并代码超80%由Claude生成。
@emollick:一个实际问题在于,当前模型已经非常出色,很难从直觉上感受到新模型在大多数单项任务上的差异,尽管AI的能力确实在大幅提升。
当前AI已很强,新模型能力提升大,但多数任务难感知差异。
@emollick: 最近几个月,Claude Code和Codex的能力大幅扩展,增加了许多工作方式(子代理、技能、目标、工作流、插件等)
Claude Code和Codex新增多种工作方式,但大量功能未文档化。
中文标题
撇开意识问题,特德·姜指出让AI做选择会导致道德萎缩;但随机试验显示AI又是好伦理学家,引人思考。
@emollick:断然认定AI在任何情况下都不可能拥有意识,可消除一系列未来AI意识可能影响产业的棘手问题
认定AI绝无可能拥有意识,可免除未来AI意识可能带来的产业难题。
@emollick:我读了这篇,非常奇怪,它认为之前的机器学习系统(非生成式AI)因数据问题未节省成本,故将导致当前AI系统投资不足
观点称早期ML因数据问题未省成本,致当前AI投资不足,引用虚假MIT研究。
@emollick:这个故事太过离奇,唯一可能勉强说得通的是,它只是某云提供商内部使用自有算力的会计占位符。即便如此,出于诸多原因,仍令人难以置信。
云提供商内部会计占位符的故事极其离奇,即便勉强解释仍难以置信。
@emollick: 开始对任何使用“真诚”或“诚实”字眼的帖子产生怀疑
对任何用“真诚”“诚实”的帖子起疑。
@emollick:五月初最佳超级预测者预测年底最长的METR 80%任务视野将达3-4小时
五月初预测年底达3-4小时,五月末Claude Mythos即实现。
@emollick: Most people, including really accomplished people, don't have an accurate mental model of how LLMs operate (and why would they?)
@emollick:嘿,这是我们的论文!
嘿,这是我们的论文!
@emollick:用Claude Code构建了一个贪吃蛇游戏,蛇意识到自己在游戏中,然后……事情就发生了。AI做出了一些令人印象深刻的创意决策(也有一些非常AI式的),我只提供了最初提示和游戏过程中的反馈。https://t.co/WdmlBD5iHI
蛇在游戏中觉醒,引发意外事件,AI展现令人惊叹的创意决策。
@emollick: My timeline seems to have people surprised that U Chicago is getting Claude, but tons of schools (including U Penn where I teach) have school-wide AI
@emollick: 全能应用仍是聊天机器人与IDE的混合体,而非为通用知识工作设计
过于强调线性输出和最终结果,缺乏研究关联与用户引导选择等。
@emollick:仅凭分数难以判断MAI-Thinking-1有多好(如GPQA和Terminal Bench 2.0异常低)
微软MAI-Thinking-1评分异常,难凭分数判断,且试用困难,表现低于Meta Spark。
Discord与Codex界面图标及底部文本框太像,致使用户混淆,误导了GPT-5.5与群聊
界面相似易混淆,引发GPT-5.5和群聊混乱。
法学教授编写办公室时间问题,Gemini 2.5与人类作答,同行盲评:胜率75%,危害性更低,新模型更强
Gemini 2.5回答法学问题胜率75%,被评比人类更少有害,且新模型表现更优。
@emollick:AI写作的另一件事
多人用AI回答同一问题(如评论、作业、申请文书),答案相似性明显且枯燥。
@emollick: 关于使用GitHub等数据的AI编程智能体大论文
AI编程代理使代码量提升17.3倍,但人类瓶颈导致实际发布仅增30%。