61629 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CV

设计性失忆,因必要而记忆:面向文档智能的持久状态

文档AI无状态,无法跨文档、会话和时间积累证据与经验;综述提出持久证据状态框架及纵向评测。

04:00
arXiv cs.CL

关键交接:混合语言模型中的检索

两跳检索中,注意力层使桥接键可用并消耗;顺序混合模型由递归层携带键,其记忆可被查询并改写答案。

04:00
arXiv cs.CL

过度解读上下文:被动暴露即可左右大模型决策

无关理由的被动暴露也会左右大模型决策,偏差近50个百分点,甚至违背用户要求、采信虚假信息。

04:00
arXiv cs.CL

MedRouter:揭示医疗大模型间的知识差异,实现基于路由的推理

MedRouter 用嵌入路由选择专科医疗大模型,强化学习优化选择,八项医疗问答基准准确率提升 8%。

04:00
arXiv cs.LG

DP-Rec:面向高效长序列推荐的动态分块方法

DP-Rec按对比熵惊讶度切分序列,压缩为动态潜行为向量,实现长序列推荐更优的效率-精度权衡。

04:00
arXiv cs.CV

通过参数域密钥嵌入的高斯图像隐写

将8位信息嵌入二维高斯参数而非像素,密钥选参微调,正确密钥无误恢复,错误密钥近随机,视觉损失小,迁移至自然图像。

04:00
arXiv cs.CL

固定却仍不稳定:同一评委内部的判定方差与LLM评委排行榜的噪声底线

固定快照、零温度的LLM评委重复判定仍不稳定:约5%条目翻转,排行榜相邻位次多难区分,需多次复跑并公布稳定性。

04:00
arXiv cs.LG

基于基准加权与块因子化 e-过程的任意时刻有效大语言模型排行榜

提出 BB-EDGE,将 LLM 排行榜视为有向图,用加权块因子化 e-过程认证优势,实现随时 FWER 控制与 Top-k 排名。

04:00
arXiv cs.LG

CompassPlay:奖励出题者,看它把求解器推向何方

CompassPlay通过梯度对齐奖励出题者,偏好与目标能力参考任务梯度一致的任务,提升性能与训练效率。

04:00
arXiv cs.LG

“我在哪里能信任你?”:代理模型保真度的边界感知评估

代理模型保真度在教师决策边界附近显著下降,且边界随训练不稳定,全局一致率不足以评估。

04:00
arXiv cs.CV

OneFixer:面向驾驶场景的高质量且一致的单步自回归3DGS细化

OneFixer以单步自回归扩散修复驾驶场景3DGS,实现高质量、时序一致、低延迟,闭环碰撞率降三分之一。

04:00
arXiv cs.AI

将诊断与疾病表征分离:神经动力学引导形变的双视图脑电学习

提出DMD-EEG,双视图分离诊断与疾病表征,以神经动力学引导的源空间低秩稀疏形变建模疾病状态,跨MDD/FEP/PD可读可迁移。

04:00
arXiv cs.CV

CausalDriveBench:评估自动驾驶视觉-语言-动作模型的因果推理

提出CausalDriveBench,评估驾驶VLA因果推理,最佳准确率70.6%,推理与轨迹预测不相关。

04:00
arXiv cs.LG

随机梯度方法中的算术简洁性

将 AdaGrad、Adam、AdamW 化为仅用加减乘和除以 2^t 的算术简单算法,并分析静态 Adam 的收敛性。

04:00
ArXiv AI

从结果到策略:面向数学推理学习策略效用

提出SURE框架,以策略奖励模型学习策略效用并融入GRPO,提升数学推理准确率且更省算力。

04:00
arXiv cs.AI

面向语言模型预训练的可扩展数据多样化:基于杠杆分数采样

提出杠杆分数采样Lev,高效可扩展地多样化预训练数据,提升多样性、速度与下游性能,缓解质量过滤跨域崩塌。

04:00
arXiv cs.LG

HM-Router:面向智能体系统的模型与执行框架联合路由

HM-Router 联合路由模型与执行框架,可泛化到未观测组合,路由准确率提升 7.3 个百分点。

04:00
arXiv cs.CL

你真的确定吗?谄媚基准中的两个混杂因素

审计SycEval谄媚基准:两个模板混杂,指定答案与格式指令随反对时机变化,可颠倒结论且可校正。

04:00
arXiv cs.AI

当有用文本有害:视觉语言模型中的选项重定向偏差

辅助文本若切题却违背图像并支持干扰项,会重定向视觉语言模型答案;提出免训练推理干预缓解。

04:00
arXiv cs.CV

PQR3D:面向多视图3D目标检测、基于参考条件时序窗口的渐进式查询细化

在参考条件时序窗内渐进细化查询,支持随机帧采样与独立推理;在nuScenes上达71.6 NDS、64.9 mAP。

04:00
arXiv cs.CV

PruneForget:视觉模型的联合遗忘与剪枝

PruneForget以遗忘集指导剪枝,联合遗忘与剪枝;在图像分类与生成模型上降推理成本,性能近重训后剪枝。

04:00
arXiv cs.CV

双耳视听实例分割

提出双耳视听实例分割任务,利用双耳空间线索分割发声实例,构建两个基准并提出模型,显著优于单耳方法。

04:00
arXiv cs.CL

让语音语言模型成为多语言倾听者

构建覆盖23种语言、9200小时的1080万条语音问答合成数据集,低成本提升语音语言模型的多语言能力。

04:00
arXiv cs.CV

面向原始3D点云的保几何盲水印

提出基于八叉树的盲水印框架,直接在xyz坐标嵌入提取,无需原始点云,抗重采样与位姿变化且失真低。

04:00
ArXiv AI

TreeRef-BFN:基于二维拓扑与内部三维几何的免等变性从头分子生成

TreeRef-BFN以树状表示与贝叶斯流网络,免等变地联合生成分子拓扑和局部三维几何,支持变尺寸条件生成,高效灵活。

04:00
ArXiv AI

AmbiModBench:超越共享响应的基因扰动预测基准测试

提出AmbiModBench,从特异性、基因分辨和覆盖度评测基因扰动预测,揭示绝对高分多源于共享背景而非目标特异学习。

04:00
ArXiv AI

DAAF:从故障定位到LLM智能体中的可编辑系统资产

DAAF学习属性替换效应,将故障定位转为可编辑系统资产的修复决策,任务成功率达71.93%。

04:00
arXiv cs.LG

面向多模态测试时自适应的表征编辑

提出FIRE,用傅里叶表征编辑器逐层校准单模态中间表征,多层目标优化以提升跨模态对齐与预测可靠性。

04:00
arXiv cs.CL

知道不等于选择:显式验证在生成式偏好之外带来了什么

生成正确答案不等于会选择;显式验证P(True)改善排序与准确率,但收益受实体和正确性定义影响。

04:00
ArXiv AI

LocalProp:神经局部化的内存高效反向传播

提出LocalProp,局部更新权重,结合剪枝与微调,在ImageNet等任务上以更低显存取得良好性能。

04:00
arXiv cs.CL

给错误的问题打分:受限选项评估中的读出失败

受限选项评分误读模型:其常续写被引题目而非预测,排序近随机;预填答案主干可提升AUC。

04:00
arXiv cs.LG

通往稳定边缘的旅程

按优化器直流增益归一化学习率后,不同优化器轨迹几乎重合,据此划分低、中、高学习率三区制,揭示稳定边缘成因。

04:00
arXiv cs.CV

面向高分辨率植物成像稠密表征迁移的可扩展域内自监督基础模型

千万级植物图像上自监督预训练ViT掩码自编码器,稠密预测Dice达0.8686,优于自然图像基线。

04:00
arXiv cs.CV

污染、先验还是证据?分解并训练全切片视觉语言模型中的证据使用

提出CleanSlide基准与Pair-DPO,剥离污染和先验,显著提升全切片病理模型对图像证据的利用与外部性能。

04:00
arXiv cs.LG

旧评估何时能认证新模型?评估器漂移下的标签高效发布决策

评估器漂移下,旧评估能否认证新模型取决于历史可信度;提出组合警觉序列认证法,高效省标签且经实验验证。

04:00
arXiv cs.AI

从异常到失败:为智能体轨迹诊断构建因果错误图

提出CEG-Agent,构建因果错误图诊断智能体轨迹,并建立CEG-Bench,达最优性能。

04:00
arXiv cs.LG

自重建动力学用于自编码器重建精化

提出SRD引导的重建精化:用冻结自编码器的自重建轨迹预测隐空间校正,无需逐样本优化,六数据集恢复45.3%可恢复MSE差距,PSNR提升1.74dB。

04:00
arXiv cs.AI

超越“提示词 vs. 技能”?模块化大语言模型程序的归因引导优化

提出SPARO,联合优化提示、技能与路由,经反事实归因定向更新组件,五基准五模型上优于基线。

04:00
arXiv cs.CV

KeyRec:面向流式与长视频理解的有界视觉记忆

免训练KeyRec以有界视觉记忆压缩流式长视频,仅10%token,15项中13项最佳。

04:00
arXiv cs.LG

博弈学习:偏斜迁移表格知识以强化图像模型

提出SKT,用两步纳什博弈自适应整合模态梯度,将表格知识非对称迁移至图像模型,提升其单模态性能。

04:00
arXiv cs.CL

超越校准:类型化决策模型的概率是否遵循概率公理?

免标注检验类型化决策模型的概率一致性;Jev与Qwen3.8-27B均违反概率公理,加和偏离1且失效模式不同。

04:00
arXiv cs.AI

向他人学习,为你行动:面向大语言模型智能体的跨用户记忆共享

ShareMem 跨用户共享经验、以接收者偏好为准,三类任务上均超越用户本地记忆。

04:00
arXiv cs.CL

语言模型预训练的泛化动态

预训练中模型在鹦鹉式与智能式计算间突然模式跳变,源于容量竞争,可优选检查点与数据。

04:00
arXiv cs.LG

双曲 Sombor 指数引导的拓扑自适应双曲图注意力网络

提出HSO-GAT,用双曲Sombor指数引导拓扑自适应曲率与注意力,节点分类和链接预测均达SOTA。

04:00
arXiv cs.CL

识别转码器中用于时间敏感事实回忆的时间特征

首次用转码器电路追踪特征级时间召回,发现三类MLP节点并行交互,揭示现有方法遗漏的高层时间组件。

04:00
arXiv cs.CV

评估单组学与多组学可解释人工智能(MOXAI)用于成人型弥漫性胶质瘤分子亚类分类

MOXAI整合甲基化与拷贝数,分类成人型弥漫性胶质瘤分子亚型,多模态准确率达92.98%,可解释关键位点。

04:00
ArXiv AI

STR:减少模型引导副作用的监督式转码器替换

提出监督式转码器替换STR,减少模型引导副作用,在Gemma/Llama上保持目标控制,攻击成功率降至12%–14%。

04:00
ArXiv AI

MemAgent:学习为LLM智能体管理异构记忆提供者

提出MemAgent,将智能体记忆建模为路由问题,管理异构记忆提供者,平均准确率提升10.0%。

04:00
arXiv cs.CV

Devol-ONE:单一自回归Transformer混合架构,统一视觉-语言-动作与潜在世界建模

混合Transformer框架统一视觉语言理解、潜在动态预测与动作生成,动作受语义与动力学共同塑造。

04:00
arXiv cs.CL

超越记忆构建:重新思考基于大语言模型的对话智能体的记忆访问

提出Threader,跳过LLM记忆重写,直接对原始交互做结构感知访问,提升准确率与证据召回并降低开销。