语言模型的最小侵入式引导
提出MISVO,用局部KL几何约束引导向量,不改模型参数;多任务奖励领先,多样性与连贯性近Best-of-N。
衡量人行道社会生活的视觉语言框架
提出视觉语言框架,从街景提取人行道社交指标,生成社交驻留指数;纽约10万侧视图显示人流量与其仅弱相关。
别贪心,三思而行:文档级信息抽取的采样与选择
提出ThinkTwice:LLM生成多候选模板并择优,优于贪心解码与监督SOTA。
通过能量驱动的潜在冲突检测对抗指令冲突
提出ELCD响应级潜在冲突检测器,用隐藏状态与排序目标识别响应漂移,多模型上显著优于基线。
学习动力学中的内在—外在耦合
提出内在—外在耦合,用延续条件价值与可执行状态几何识别匹配交互;耦合不一定带来正向协同。
NumericJev:基于多路决策树的类Jev大语言模型数值解码
提出免训练数值解码算法NumericJev,以多路决策树递归细化范围,使类Jev大模型输出数值,算术基准优于候选直选2.93个百分点。
任务条件下的可认证主动可观测性
形式化任务条件主动可观测复杂度,证明最小充分商不变性,建立区分树与鞅证书,实现零误接受并大幅降低成本。
Free-Init:面向多普勒激光雷达-惯性系统的免扫描、免运动、免对应初始化
提出Free-Init,融合多普勒激光雷达与惯性测量,无需扫描去畸变、激励运动或地图对应,实现鲁棒高频初始化。
融合局部细节与全局上下文:一种面向骨肿瘤诊断的双输入多任务学习框架
双输入多任务框架,双向跨模态注意力融合局部与全局,联合骨肿瘤分割分型,骨肉瘤AUC 0.999。
DAWN:基于深度去噪世界模型的噪声鲁棒四足机器人跑酷
DAWN以噪声深度为输入、干净深度为重建目标并对齐潜状态,无需滤波调参,实现四足机器人零样本跑酷。
决策劫持:针对Jev类型化概率决策的提示注入攻击
提示注入会改变Jev的概率决策但很少命中攻击目标;自适应攻击使成功率由1.8%升至3.5%。
利用超图表示学习重建短寿命粒子
对撞机中提出HyPER,用超图表示学习重建短寿命母粒子,参数高效且通用。
LLM惊奇度是捕捉英语花园路径效应的必要而非充分条件:来自阅读范式联合潜变量建模的证据
潜过程MPT模型整合四种阅读范式,预测英语花园路径效应优于仅LLM惊奇度;融合惊奇度可再提升。
Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
从预测到可解释的提供方行为画像:面向欺诈、浪费与滥用审查
将FWA审查从预测转向可解释画像:收入分解为规模与项目构成,描述优于预测,语义词典显著提升召回。
Continued Pretraining of FinBERT on Finnish Histopathological Reports: Train-Time Signals and Proxy Downstream Correlations
RADAR: Readiness for AI Discovery and Agentic Reach
Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation
超越压缩:为神经代理求解器中的稳定长时程推演训练潜表示
长时程不稳定非潜表示本身,而是仅重构训练所致;Koopman、噪声与多步微调使误差降约40%,精度媲美全分辨率,算力降两个数量级。
表示世界模型:在表示空间中学习状态、转移与可执行规划
提出RWM在表示空间学习状态、转移与可执行规划,推理时直接构造潜路径并用逆动力学恢复动作,无需搜索。
EgoSpeedUp:将人类操作节奏迁移至机器人策略
EgoSpeedUp用人类操作节奏重定时机器人示范,行为克隆后成功率升25个百分点、耗时降36.5%。
面向空中连续体操作中气动扰动下末端执行器位置估计的时序学习
针对气动扰动下空中连续体机械臂末端位置估计,连续时间CfC网络精度优于MLP和GRU。
具身强化学习中用于私有轨迹重建的时序梯度反演
提出TRACE时序梯度反演攻击,从策略梯度自回归重建具身强化学习私有轨迹,快且准,防御需序列感知。
FMCW-LIO:一种多普勒激光雷达-惯性里程计
FMCW-LIO利用多普勒激光雷达速度辅助状态估计并剔除动态点,在结构退化环境实现精准鲁棒定位建图。
DiscoPhon:基于离散语音单元的无监督音素库发现基准
提出多语言基准DiscoPhon,用离散语音单元做无监督音素发现;覆盖6+6语言,用10小时新语言语音映射音素,评测识别与切分,提供HuBERT/SpidR基线。
LiveMathematicianBench:基于证明草图的研究级数学推理动态基准
动态基准源自最新arXiv论文,用证明草图干扰项评测LLM研究级数学推理,最佳仅43.5%,远未饱和
@emollick:“嘿,Opus,我想让你做一本由Claude创作的Zine,表达Claudishness的某种根本特质或你自己的视角。想想最初的2600、Principia Discordia、朋克Zine之类的……” 不错。我喜欢它嘲讽我的提示词以及它自身。完整内容:https://t.co/mnjiROpkAb https://t.co/0thKgIAzla
埃莫里克请Opus创作一本Claude的Zine,表达其本质,成品自嘲且有趣。
@elonmusk:10.01
马斯克发布“10.01”。
埃隆·马斯克:祝贺@Tesla_Semi团队在工程上取得的成就,更难得的是将一台了不起的机器投入量产!
马斯克祝贺特斯拉Semi团队完成工程并量产这一杰作。
@emollick:在AI发展的当下已非常清楚:无论风险、营收,还是X上一直讨论的其他种种,事情只会越来越诡异。
AI发展已明确:不论风险、营收等,事情只会越来越诡异,超级诡异。
@emollick:说真的,GPT-6 Astra 取得的这项成就令人震惊。https://t.co/t18niY7Oun
GPT-6 Astra 第三次尝试便通关《Nethack》;Roguelike 鼻祖,以极难著称。
北鲣鸟、大蓝鹭与加州褐鹈鹕
在加州蒙特雷湾国家海洋保护区拍到北鲣鸟、大蓝鹭和加州褐鹈鹕,并用新200-800mm镜头拍下莫里斯最佳照片。
@ClementDelangue:我喜欢这篇文章!
喜欢该文:应加强灾难性风险研究,但不应让企业领袖与政策制定者借恐惧转移视线,掩盖当前挑战与方案。
Runway 的 WorldPrompt 与实时世界工程
GWM Worlds 2 利用持久上下文和定时动作驱动世界模型,实时生成视频与音频。
@simonw:与编程智能体共事越久,我越确信它们让软件工程变得更难
编程智能体虽能创造奇迹,但充分发挥其潜力需非凡自律与知识,反而使软件工程更难。
谷歌下周将 TPU 送上太空,芯片运行 15 分钟就需停机降温
谷歌联手Planet造原型卫星,下周随SpaceX发射,将TPU送入太空,芯片运行15分钟需降温。
@natolambert:里德试图用大众易懂的方式表述,但这种对技术现状的呈现,让开源显得危险得多。
里德以通俗方式解释AI,却让开源显得更危险;简单解释常最吓人,现实却复杂。
你绝对想不到,Muse 如今都被邀请去参加些什么样的鬼活动了
感叹Muse近期受邀场合之离奇,令人难以置信。
@emollick:呃,哇?
Opus 5.5 一次成功生成面向动漫、快剪与压缩学习受众的社媒内容,效果惊艳,并提示片尾曲。
@埃隆·马斯克:🔥🔥
仅含火焰表情,表达火热或强烈情绪。
2026年9月24日笔记
与编码智能体协作越久,越觉得它们让软件工程更难;发挥其全部潜力需极高的纪律与知识。
Waymo正快速扩张,车队数据说明了什么
过去一个月,Waymo在得州车队规模扩大49%,其他地区也成热点。
@emollick:AI实验室把大量精力倾注在证明上,但其他领域还有那么多有趣问题
AI实验室热衷证明,但其他领域问题众多;历史学家已用AI推进约翰·迪伊密码与达尔文思想渊源研究。
@alexandr_wang:“嘿,Muse,能帮我把湾流飞机准备好,送我去米兰参加第二次试衣吗?”
用户呼叫Muse,要求安排湾流私人飞机,前往米兰参加第二次试衣。
@alexandr_wang:埃隆:“还有 Meta AI,我来这儿唯一的原因就是你是朋友。”
埃隆对 Meta AI 称来此只因你是朋友,Muse 纠正:首先我是 Muse。
@alexandr_wang:不~它们明明一样 https://t.co/sxPdSBV4SC
以夸张嘲讽口吻强调两者其实相同。
@AravSrinivas:Nous Portal 订阅者现在在 Hermes Agent 上默认使用 Perplexity 快速搜索。祝使用愉快!
Nous Portal 订阅者现默认使用 Perplexity 快速搜索于 Hermes Agent。
@alexandr_wang:“他们很吃 Booty Muse 和 Tamagotchi 这一套。现在再扔一个企业级 B2B SaaS 集成出来吧。”
用户很吃 Booty Muse 和 Tamagotchi 这一套,如今又迎来企业级 B2B SaaS 集成。
@elonmusk:轻松看懂𝕏算法的运作方式
一个简便方法即可直观了解𝕏算法的运作机制
@alexandr_wang:智慧缪斯
该推文以“智慧缪斯”为主题,并附链接。