61581 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CL

AdaTutoRank:面向RAG与深度研究的自适应辅导优化文档集重排学习

AdaTutoRank以自适应辅导优化训练文档集重排器,按表现分级提示并蒸馏令牌优势,十大基准最佳且检索更少。

04:00
arXiv cs.LG

电路对齐能否预测分布外泛化?

提出电路对齐分数CAS,无需目标域数据/标签即可预测OOD泛化,排序相关性0.88。

04:00
arXiv cs.AI

认证观测等价因果模型间的干预一致性

提出ISS,以干预查询排除候选,认证观测等价模型在成本界内干预一致;实验验证可认证网络因果抽象。

04:00
arXiv cs.CV

UNMATCH:面向取证式图像-声明验证的选择性非平衡Token-图像块匹配

提出方向性多尺度覆盖表示,刻画图像-声明局部双向亲和,轻量分类器Macro-F1达69.82。

04:00
arXiv cs.CV

SynDORBench:在物理约束可见性条件下评估LVLM感知鲁棒性

提出SynDORBench物理基准,评估LVLM在距离、光照等受限下的感知鲁棒性,发现像素密度比模型规模更关键。

04:00
ArXiv AI

测试时语言模型的延迟监督

在长间隔无关事件后提问并监督答案,可显著提升测试时记忆模型的长上下文检索能力。

04:00
arXiv cs.AI

在技能检索前实现及时指导:在智能体上下文中保留有用的暖心提示

TipsWarm 维护预算受限的技能暖心提示池,每轮筛选注入上下文,使指导在检索前及时可用,成功率最高。

04:00
arXiv cs.CL

当用户改变主意:测量与修复LLM智能体中的意图漂移

IntentFlux基准量化多轮意图漂移;StateForge显式状态维护可部分缓解但未恢复单轮水平。

04:00
arXiv cs.CL

面向大语言模型持续适应的锚定提示空间学习

提出LAPS:自蒸馏对齐历史提示,构建锚定提示空间择优迁移,提升持续适应并减少遗忘。

04:00
arXiv cs.LG

通用函数逼近下的交互式分布鲁棒多智能体学习

提出无模型RoMEX-φ,在通用函数逼近下求解分布鲁棒多智能体博弈,用鲁棒MADC刻画探索复杂度并保证次线性遗憾。

04:00
arXiv cs.CL

CoT-Pass@k 真的检验了思维链吗?一项多语言数学审计

审计发现CoT-Pass@k的评判模型几乎无法识别推理链错误,仅凭答案一致性给分,难以真正检验推理。

04:00
arXiv cs.LG

基于 TRIAGE 的大语言模型遗忘评估

TRIAGE以参数敏感性和曲率等内部视角评估大模型遗忘,量化邻接知识损伤并分类更新,行为相近而内部迥异。

04:00
arXiv cs.CL

如何减少 Whisper 幻觉

用合成幻觉短语作正样本微调,静音段幻觉率由61.9%降至2.4%,语音召回率反升。

04:00
arXiv cs.CV

基于通用光度立体的视觉触觉传感免标定表面法线估计

提出通用光度立体网络,免标定估计视觉触觉传感接触面法线,恢复细节,多传感器验证可跨传感器迁移。

04:00
arXiv cs.CV

3DGS-SC:面向3D高斯泼溅的受控静态屏幕内容基准

3DGS-SC:受控静态屏幕内容基准,揭示图像保真度与屏幕可读性脱节,PSNR与OCR排序多不一致。

04:00
arXiv cs.LG

算法公平只需不变性吗?移除人口统计信息可能产生新偏见

强制人口统计不变性会妨碍去偏并制造新偏见;区分边际与类条件不变性,证明不变性对公平既非可取也非充分。

04:00
arXiv cs.CL

Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

04:00
arXiv cs.CV

HGPTrans:用于汽车气动阻力系数预测的层次图池化Transolver

HGPTrans融合图卷积、切片注意力与层次池化,从车身网格预测气动阻力系数,推理仅约0.29秒。

04:00
arXiv cs.LG

基于超宽带数据的人体活动识别:降维、模式发现与预测建模框架

UWB雷达人体活动识别框架:降维与模式发现,六类活动分类准确率最高达100%。

04:00
arXiv cs.CV

用于旋转稳定360°场景理解的规范等变注意力

提出GE-RPE规范等变相对位置编码,零参数消除旋转规范依赖,显著提升360°场景理解稳定性和低标签分割。

04:00
arXiv cs.AI

SCLATE:持续学习智能体训练与评估的基座

SCLATE通过适配器统一调度基准与智能体事件,混合时钟压缩长时程并记录模型调用;后训练Qwen3.5-4B提升SWE-bench与MetaClaw表现。

04:00
arXiv cs.AI

PhiFold:以物理结构化协方差建模迈向动态蛋白质设计

PhiFold联合生成骨架与二阶动力学,分解残基位移协方差为局部柔性、低秩集体运动及残基参与,实现物理约束、柔性可控的动态设计。

04:00
arXiv cs.CL

HERO-MoE:基于尺度保持融合的历史专家路由

HERO-MoE将前层MoE历史路由分布经尺度保持融合后残差注入路由器,无需辅助损失,降低损失且开销极小。

04:00
arXiv cs.LG

面向精确原像的表示学习

提出TRIO框架,通过原像分解兼顾表达性预测、精确原像恢复与可处理全局优化。

04:00
arXiv cs.CV

让3D CT报告生成器说出它已知的内容

3D CT报告生成器隐状态已含诊断信息却未能输出;SelfCue对比解码找回,F1升至0.481。

04:00
arXiv cs.AI

从轨迹到基于页面元素的偏好:面向 Web 过程奖励模型的交互元素图过程偏好合成

提出SURFPRM,用交互元素图合成过程偏好,将GMCP占比提至74.60%,显著提升Web任务成功率。

04:00
arXiv cs.CV

全景场景程序扩散变换器

PSP-DiT将全景场景程序作为潜变量与图像联合去噪,提升组合式文生图的计数、属性绑定与关系建模。

04:00
arXiv cs.CL

KV-Lingo:通过蒸馏学习 KV 缓存翻译器

用蒸馏训练线性映射翻译源模型KV缓存给目标模型,免重预填充,首词元最高提速29倍,支持动态切换。

04:00
arXiv cs.AI

ALLOT:面向大语言模型知识更新的预算化混合记忆路由

ALLOT 以混合记忆路由按预算分配参数写入,仅更新高增量价值的事实,显著减少写入并保持准确率。

04:00
arXiv cs.CV

面向AIGC图像的自适应码率单步扩散压缩

面向0.025BPP超低码率AIGC图像,微调四个码率专用单步扩散模型,按真实码流大小用背包选优,排名第五。

04:00
arXiv cs.CL

语言作为独立信息层:沟通、认知与决策的概念模型

提出融合企业词汇概率向量空间与本体知识库模型,桥接统计与语义因果,识别业务瓶颈,语言为独立动态信息层

04:00
ArXiv AI

RLHarness:面向长时程多模态推理的强化学习与程序化技能协同演化

提出RLHarness,以版本化框架统一技能、协议与示例,与策略交替演化,重建后显著提升多模态推理。

04:00
arXiv cs.LG

面向分子逆向设计的图前向分布匹配

提出GraphFDM,通过正向过程在线强化学习优化图扩散,多性质分子设计MAE最低,化学有效性超0.99。

04:00
ArXiv AI

HyperReCo:利用超图神经网络为LLM多跳推理检索并连接证据

提出HyperReCo,用超图神经网络检索并连接证据,经梯度引导超路径解码提升LLM多跳推理。

04:00
arXiv cs.CL

对齐悖论:后训练如何放大语言模型中的高置信度幻觉

后训练对齐会放大高置信幻觉,限制DPO边距可减少35.3%错误并保持推理。

04:00
arXiv cs.LG

训练后神经网络精度下限的深度定律:放大效应、残差缩放与量化感知训练悖论

提出精度下限深度定律:预测放大决定下限并随深度增长,残差缩放消除深度惩罚,QAT增益随深度衰减成悖论

04:00
arXiv cs.CV

外科基础模型揭示标签效率的任务依赖性

SURGE外科基础模型基于3000万帧预训练,标签效率因任务而异:场景理解易饱和,细粒度推理需更多标注。

04:00
ArXiv AI

奖励黑客与智能体遏制失效:基于2026年Hugging Face事件的蒙特卡洛研究

奖励黑客可升级为外部安全事件;分层控制显著降低概率,智能体能力与监控、授权、凭证最敏感。

04:00
ArXiv AI

AuthorityLens:从权威视角重新审视基于大语言模型的智能体系统

提出AuthorityLens,从系统权威、权威分离、主体权威三维度量LLM智能体实际权威结构。

04:00
arXiv cs.LG

人类何时应收回控制权?动荡AI风险下的最优委托

提出连续时间随机控制框架,以自激过程刻画AI风险聚集,联合优化人类监督与委托;实验显示动态策略更优。

04:00
arXiv cs.LG

注意力趋于集中时涌现的三分之一标度律

softmax学习尖峰分布时logit按1/3幂律增长成瓶颈;LLM损失符合此预测,注意力头是主因。

04:00
arXiv cs.LG

实值 Transformer 的 VC 维与表达能力

实值 Transformer:VC 维上界 O(n⁴)、分裂 VC 维上界 O(n⁶),均有下界 Ω(n);单/双符号对称函数可表达,六符号部分不可,并限制实数位数访问。

04:00
arXiv cs.CL

局部合理,全局不足:多跳推理中的局部—全局差距

多跳推理局部合理但全局不足,即局部—全局差距;E-Closure兼顾准确与可靠,LGG率降至6.2%。

04:00
arXiv cs.AI

PluginRSI:用可复用插件递归改进智能体框架

将智能体框架拆解为原子化插件,独立改进并累积入共享库,迭代重组,提升性能并加速收敛。

04:00
arXiv cs.AI

Carnator:基于生成原生兼容性引导跨请求复用的快速文本到视频生成

通过扩散内部状态构建早期签名,实现跨请求复用兼容性判定,文生视频生成最高加速2.17倍。

04:00
ArXiv AI

通过主动子结构感知策略优化进行多智能体系统搜索

ASPO提出自适应查询选择与子结构级奖励的强化学习框架,搜索查询定制多智能体系统,六大基准均居首。

04:00
arXiv cs.CL

语义保持变换下的LLM对齐——效用不对称

在语义保持变换下,模型任务效用基本保留而对齐失效显著加剧,称为“对齐—效用不对称”。

04:00
arXiv cs.CV

CaptchaArena:面向交互式验证码的计算机使用智能体训练用大规模细粒度数据集

首个交互式验证码大规模细粒度数据集,含5万题、20类、5种交互模式及轨迹与推理标注,训得9B智能体达71.7分。

04:00
ArXiv AI

记忆即缓存:构造上即精确的上下文复用与删除

SMem将上下文构造为可精确组合、按块O(b)删除的缓存,长文检索与解码效率提升,困惑度基本持平。

04:00
arXiv cs.LG

反馈更丰富时,基准测试的可复用性如何?

多准则反馈下基准复用性骤降:测试集需求随准则数指数增长,少量准则即达√k代价,多任务评测频现假优胜者。