@fchollet:定期提醒——公开ARC 3游戏集称为“演示集”,而非“评估集”或“训练集”。它不应用作训练数据或评估,其分数不代表真实表现。
公开ARC 3游戏集仅为演示集,非训练或评估集,其分数不具代表性。
@fchollet:Jeremy 的出色工作很好地展示了一种非常强大的方法:LLM 引导的即时符号世界模型合成,即通过编写可执行代码来编码你对世界因果机制的理解,从而理解世界。
LLM引导即时合成符号世界模型,用代码编码因果机制理解世界。
@fchollet:编程并非又一个应用领域——而是AI借助符号世界模型自动开发自身训练材料所需的元技能,RSI循环正是由此真正启动。
编程是元技能:AI借助符号世界模型自动生成训练材料,从而启动RSI循环。
中文标题
建设者尊重建设者。最喧哗、最恶毒的仇恨者几乎总是那些从未建造过任何东西的人——无名空谈客。
@fchollet:事后看来,这是一个相当不错的投资论点。GPU、CPU、内存、数据中心供应商等,且该论点依然成立。
事后看来,投资GPU、CPU、内存及数据中心供应商是明智的,该投资逻辑至今依然成立。
@fchollet:关于谷歌衰亡的报道被过分夸大了。我不会低估他们。
谷歌并未衰亡,报道过于夸张,不可低估其实力。
@fchollet:在基础LLM扩展时代(2022-2024),我曾认为LLM研究方向会达到能力天花板(正如后来基础LLM所表现出的)
曾认为LLM扩展会触达能力天花板;o3测试时计算演示后改观:新模型展现真正流体智能。
@fchollet:Keras社区通话现在开始,加入链接见下方推文。
Keras社区通话开始,加入链接见推特。
Keras社区电话会议将在15分钟后开始!
Keras社区电话会议15分钟后开始,请准时参加。
@fchollet:随着智能体AI的兴起,工作流越发依赖CPU,认知向CPU转移的比例持续上升。
智能体AI使工作流更依赖CPU,认知负载持续向CPU迁移。
@fchollet:Keras社区会议将于本周五上午10点(太平洋时间)举行——团队将展示Keras生态系统的最新进展,特别是新的vLLM集成。
Keras社区会议周五10点PT召开,展示生态最新进展,重点为vLLM集成,任何人可加入。
@fchollet:我要明确一点:2023年和2024年初,我对LLM将扮演的角色判断有误,低估了其长期重要性。我已多次承认此事。
承认曾低估LLM长期重要性,2023至2024年初判断失误。
@fchollet:我本以为显而易见,但以防万一:一个百万行代码库(即“脚手架”)在推理时运行,为任何任务编排对神经网络的数千次调用,这正是“神经符号架构”的确切定义。
百万行代码库在推理时编排数千次神经网络调用,即神经符号架构。
@fchollet:我们需要开放框架来评估模型行为。讨论需基于可审计的测量,而非“我们vs他们”的情绪。
呼吁开放框架评估模型行为,讨论应基于可审计测量而非对立情绪。
@fchollet: 当前AI“讨论”中很大一部分与其说是技术能力,不如说是前沿实验室员工在应对自尊和身份认同
当前AI讨论多是员工应对自尊和身份认同,而非技术能力。
@fchollet:科学中不仅要报告成功的实验,也要报告失败的。AI也应如此。(真希望如此。)
科学需报告失败实验,AI亦然。
@fchollet: 一个非常有趣的概念——智能体不再针对静态基准或内部生成的奖励模型进行优化,而是通过真实的经济互动进行评估。将外部市场作为奖励信号的一部分,从根本上改变了优化问题。
以真实经济互动替代静态基准,外部市场信号重塑优化问题。
@fchollet:儿童个性的先天特质显而易见,因为他们尚未经历有意义的环境或自我引发的改变,展现原始天性。
儿童凸显先天个性,但长期经验会显著重塑人格。
@fchollet:人们习惯认为所有已知问题已有规范解法,且已最优,试图重造是徒劳的堂吉诃德式努力。
多数人误以为现有解法已最优,创新是徒劳,实则一切皆由人创造。
中文标题
不确定旧金山人频繁使用“xyz-shaped”是因为大语言模型的影响,还是反过来。
@fchollet:始终牢记变化率比当前指标值更重要
谨记变化率比当前指标值更重要。
@fchollet:AI能力历来分布极不均衡,某些狭窄领域超人类,其他领域几乎无用。AI行业的基本营销伎俩是让你相信最高的尖峰就是地板。
AI能力分布呈尖峰状,行业营销用最高点冒充普遍基准。
@fchollet: 哥德尔式幽默是自指的
哥德尔式幽默的特征在于自我指涉。
@fchollet:对Harvinder和Suman在@airtap_ai的成果印象深刻,他们已将短信变成移动应用的无头代理执行层。
短信变无头代理,发文字即可后台操作应用。
@fchollet:万事层出不穷
世事繁多,纷至沓来。
@fchollet:标准强化学习基准是片段式和静态的,无法反映真实部署特性。Morpheus是一个新的持续学习基准,提供永不重置的持久模拟环境,目标会变化
Morpheus持续学习基准提供不重置的持久环境,目标动态变化,弥补标准RL基准不足。
尝试、失败、更新心智模型、再尝试的过程是智能的核心。我们应该赞美那些能优雅失败并即时适应的模型。
智能核心:尝试、失败、更新模型、再尝试。应赞美优雅失败并即时适应的模型。
@fchollet: 去年底前的弱AI代码生成提升了低技能程序员下限,但对高技能无益;强AI则彻底反转局面
弱AI代码提升低水平程序员,对高水平无用;强AI完全反转。
@fchollet:报告基准结果仅用标量数字(如“75%”)已毫无意义,应始终报告效率分数(如“每任务成本$10时达到75%”)
基准结果应报告效率及成本,而非纯标量数字。
中文标题
现实皆可编程,关键在于建模。