衡量同质面板LLM辩论中的崩溃与纠正
提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。
超越令牌节省:LLM智能体上下文压缩的系统性研究
系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。
SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序
SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。
数据应当教会什么?在电路、存储与使用间迁移瓶颈
电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。
RBF-GNN:面向伪坐标图卷积的有理基函数
提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。
评分标准感知的同策略自蒸馏:面向大语言模型个性化
提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。
基于通用函数逼近的抗饱和对决老虎机
研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。
当文字比图像更响亮:理解视觉语言模型中的语言偏见
VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。
约束流策略更新:广义薛定谔桥视角
提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。
裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡
重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。
偏微分方程先验的高效消息传递
基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。
从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样
提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。
CADOC:面向长时程智能体的缓存感知动态对象上下文
CADOC批量替换上下文对象为卡片,保留按需检索,输入成本降约40%,性能接近全上下文。
神经符号计算机使用:学习可复用策略以实现可靠高效的执行
提出神经符号计算机使用,将重复工作流固化为可复用策略,神经模型处理依赖观测的决策,大幅降本增效。
MotionInsight:诊断生成视频中的物体运动缺陷
提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。
首个面向交通信号控制的视觉-语言-动作模型
首个基于视觉-语言-动作模型的端到端交通信号控制方法,直接从多视角路侧视频映射为协调信号动作。
NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子
NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。
双通道鲁棒群相对策略优化:基于优势与序列权重估计
提出双通道鲁棒优化器RoVR-GSPO,以有界残差信用与SoftRoVR聚合稳健估计优势和序列权重,抗奖励污染与比率异常,优于GSPO。
CoEM:以证据确认记忆赋能长上下文推理
CoEM暂存原文证据,随新上下文决定提升、保留或丢弃,经验证器校验,强化学习训练,提升长上下文推理。
OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型
提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。
SCA:面向GUI智能体强化学习的空间信用分配
提出SCA,用点击坐标细化组相对信用,提升GUI智能体定位与动作预测,部署策略不变。
Real2Gym:从视频构建仿真训练场,让机器人获得技能
提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。
无承诺的上下文:非刚性变形下的鲁棒稠密对应
CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。
Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理
无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。
CF-LoRA:解耦因子聚合与适应感知客户端聚类用于联邦LoRA微调
CF-LoRA通过解耦因子聚合与适应感知聚类,解决联邦LoRA微调的聚合与协作不匹配,提升异构数据下的精度。
REALHOP:以行为审计重新审视多跳推理评估
提出行为必要性率(BNR):答案正确≠多跳推理;REALHOP将BNR从27.4%升至94.4%。
GleanVID:面向高效视频大语言模型的互补Token选择
GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。
为了规划,世界模型必须区分什么?
规划无需保留全部物理差异;需保留什么取决于查询、候选集与规划器;建议查询定搜索、动作模型预测的模块化设计。
FactorEngram:面向语言模型的基级门控因子化 N-gram 记忆
提出因子化n-gram记忆:以共享基向量字典检索稀疏系数,并用基级上下文门控逐分量调制,提升语言建模与下游性能。
谁在谁的左边?追踪相对位置推理中的空间证据与角色绑定
揭示相对位置推理中空间追踪与角色绑定两组件,干预内部表征可提升模型准确率与配对一致性。
UniBuild: Unified Building Mapping From Multi-Source Optical Remote Sensing Imagery With Detail Decoding and Geometry Regularization
未知链接下的低秩单指标赌博机:从矩阵到张量
研究未知链接与低秩指数的矩阵/张量赌博机,T-ESTOR和T-BSTOR分别在单调与非单调链接下达到最优遗憾率。
卢卡西维茨神经网络扩展:面向可解释规则提取的残差架构与结晶策略
残差连接将卢卡西维茨网络扩展至任意深度并保持合并神经元符号对应;分析三种结晶策略以促进可解释规则提取。
ImbalancE:应对链接预测中度数不平衡的推理时隐空间搜索
提出推理时隐空间搜索,缓解链接预测中度数不平衡偏差,提升最不平衡三元组预测。
面向矩阵优化器中自适应 Newton–Schulz 的零开销谱估计
用牛顿–舒尔茨迭代中的格拉姆矩阵谱矩,无额外矩阵乘法即可估计奇异值谱,自适应选择多项式,降低正交化误差。
少些谄媚,更强拒绝?机制可解释性对AI安全的启示
机制可解释性表明:降低谄媚不保证直接拒绝更强,但能在用户施压下恢复部分拒绝能力。
平衡早期性能牺牲与长期收益:跨训练时长缩放学习率预热时长
预热时长应随训练时长与峰值学习率缩放,短训练拟合可预测长时训练最优预热。
LDM-is-AE:潜在扩散模型是用于端到端图像生成的自编码器
提出LDM-is-AE,将潜在扩散模型自身视为自编码器,端到端联合学习潜表示与去噪,无需独立分词器,FID达1.80/1.90。
生成模型增强推荐系统相关的算法危害
论文扩展算法危害分类体系,涵盖生成模型增强推荐引发的新型表征、服务质量与内生危害,并作因果分析。
超越词元规模:面向可靠语义特征发现的块级稀疏自编码器
提出块级稀疏自编码器,以分块均值激活学习可靠语义特征,提升检索、推理检测与引导。
自发的上下文恢复:语言模型如何从损坏输入中恢复
语言模型可自发从损坏输入恢复;恢复分两阶段,隐藏状态可预测失败,探针AUC约0.78,适度损坏微调增强鲁棒性。
SketchSSM:写入完整状态,从紧凑草图读取
SketchSSM通过缓存基向量输出构建紧凑草图,避免解码时全状态读取,状态访问流量减少约10倍,内核加速最高7.78倍。
ALMIEYAR:面向多方言阿拉伯语语音识别的文化根基型基准
覆盖17种阿拉伯方言、13.7小时录音,评测12个ASR系统,最佳WER仍达35%,首建阿瓦兹方言基准。
意大利儿童语音音素识别的深度学习技术
Broca仅用不足3小时意大利儿童语音微调,音素错误率达13.36%,助力低资源临床语音评估。
混合注意力大语言模型中的多语言性
首次研究混合注意力对LLM多语言性的影响:跨语言表示随层序变化,调整层序可使训练提速2.5倍。
AwarenessBench:评估语言模型的认知能力
首个语言模型认知能力基准AwarenessBench,含四维度15项功能。18个模型均超随机基线,最佳者总体胜人类均值,但元认知与自我意识仍落后,认知独立于推理进步。
DevelopmentODE:面向十年间早期脑发育动态的结构化神经常微分方程
提出结构化连续时间模型,融合群体轨迹与个体差异,能从稀疏纵向fMRI预测儿童脑发育,长短时程均优于基线。
盲区中的速度:自动驾驶视觉语言模型动态感知的可解释性分析
VLM车速理解存盲区:潜表征可解码却难表达,时序利用弱,专用模型仍有差距;规划合理≠状态可靠。
AraDynFact:阿拉伯语事实知识的动态评估
提出AraDynFact动态框架,基于阿拉伯语维基百科自动评测大模型事实知识,并与人工基准高度相关。
基于边界动力学的零存储程序化神经合成:Lean 4 形式化验证与裸机严苛测试验证
提出WERR/OED零存储程序化神经合成,以24字节种子沿Mandelbrot边界生成决策;Lean 4验证10条定理,EVM gas≤22557,无VRAM,达15397决策/秒。