59131 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.LG

Nous:在源校准之前学习并认证记忆决策

学习与认证记忆决策可比源校准少用平方级数据,且证书在MiniGrid中验证有效。

04:00
arXiv cs.CL

当数据伪影并非捷径:合成RLVR语料的因果审计

审计合成RLVR语料:可检测伪影未被模型利用,利用差0.021低于对照0.027,代码域几近无信号。

04:00
ArXiv AI

EviGraph:面向时序公共服务知识图谱的携带证明式选择性推荐

区分关键决策需求与可留待未决信息,用语言代理链接时序图谱证据并确定性校验,减少不必要弃答。

04:00
arXiv cs.LG

分类器的四种生长方式,以及为何其中一种无法学习

四种生长方式中,最自然的分裂叶子加深深度之法因梯度恒为零而无法学习;小随机扰动即可修复。

04:00
arXiv cs.CL

EurekaBench:衡量智能体发现新科学洞见的能力

新基准EurekaBench含26项跨领域长程任务,评估AI智能体发现科学机制的能力;结果显示其预测精度超人类,但科学洞见提炼明显不足。

04:00
arXiv cs.CL

CAVE-Mem:面向记忆搜索的边界感知经验验证

CAVE-Mem免训练框架将经验建模为带边界条件的干预算子,匹配时才应用,否则弃权,效果优于纯相关性复用。

04:00
arXiv cs.CV

EgoRefine:面向异步协同感知的自车参考预测对齐与轨迹条件可靠性感知融合

提出自车参考预测对齐与轨迹条件可靠性融合,缓解异步协同感知特征错位,提升3D检测精度。

04:00
arXiv cs.CV

DramaAgent:智能体驱动的故事视频生成

提出分层智能体框架,将长视频生成分解为故事规划、角色保持、分场合成与反思修复,提升长篇连贯与音画同步。

04:00
arXiv cs.LG

面向多专家区间目标的不确定性感知学习

保留多专家区间,分离标签内不精确与专家间差异,匹配预测不确定性;海冰浓度MAE降31%

04:00
arXiv cs.LG

需要多少类别才够?少样本异常阈值的无分布认证极限

少样本异常阈值认证需大量独立类别,分布无关95%置信下界至少14–59类,证据不足只能失败关闭。

04:00
arXiv cs.CL

面向风险校准意图路由的有符号词汇置信度

提出有符号词汇门控,融合分类器与稀疏词法证据并校准阈值,降低风险-覆盖曲线下面积,提升意图路由覆盖率。

04:00
ArXiv AI

分布式多智能体委托中的容错预算守恒

分布式多智能体委托的容错预算守恒机制,通过独占托管信用与调度许可,在崩溃、重试、分区等故障下防止超支。

04:00
arXiv cs.LG

广义生物医学发现

提出广义生物医学发现基准与SCAN方法,通过预测抑制、惊异显著性和互补适应,提升新概念发现并保留已知知识。

04:00
arXiv cs.CV

评估受控雾退化下反无人机检测的鲁棒性:雾感知训练与晴空性能权衡

首个按雾浓度分级的基准发现,反无人机检测性能随雾非线性骤降,雾感知训练提升全等级但牺牲少量晴空精度。

04:00
arXiv cs.CL

DuplexSpeechBench-文档接地:语音智能体中文档接地与幻觉的基准评测

语音智能体文档接地基准DSB-DG,含五领域1636问答,评测上下文饱和与接地衰减,级联系统最佳。

04:00
arXiv cs.CV

低接地分数并不意味着评判器未接地:识别多模态监督中的可感知性混杂因素

视觉接地分数受图像编辑可感知性限制,易误判为无依据;可用审计三量识别误报,并辅以未编辑图像检测上界。

04:00
arXiv cs.LG

99% 准确率的隐藏代价:电信客户流失基准的可信度审计

基准99%准确率暗藏四类缺陷:SMOTE泄漏虚高F1、冗余特征扭曲SHAP、校准失效、成本阈值被忽视。

04:00
arXiv cs.CL

确定性不只是正确性:重新思考大语言模型推理中的词元级确定性

确定性更擅长识别问题难度而非区分同题答案对错;信息随词元类型与位置变化,据此分配采样可提升精度并降低成本。

04:00
arXiv cs.CL

CAST:来自单次前向块草稿器的成本感知投机树

复用块草稿器已评分的候选构建投机树,按验证成本自适应树宽、单次验证,提速最高43%且输出分布不变。

04:00
arXiv cs.CV

GPEC:用于心脏视频描述生成的高效预LLM高斯过程嵌入校正

GPEC在大语言模型前校正视觉嵌入,提升心脏超声视频描述质量与内容对齐,推理开销低于0.05秒。

04:00
arXiv cs.LG

基于关联规则算法的乳腺癌分类

乳腺癌高发,本文提出基于关联规则的加权分类算法,含规则生成、剪枝和预测,并在测试样本上验证。

04:00
arXiv cs.LG

对谁有用?样本价值仅相对于学习器而定义

固定子集、只换学习器:样本相对价值与选择边界随宽度、步幅和架构而变,故须按目标学习器评估选择策略。

04:00
ArXiv AI

Build2SPARQL:面向建筑知识图谱查询的大规模文本到SPARQL基准数据集

提出建筑知识图谱文本到SPARQL大规模基准,含6136条查询、30680个问题,检索增强显著提升准确率。

04:00
arXiv cs.AI

预测信用:衡量科学解释对实验预测的增量贡献

配对预测评估科学解释的预测增益;预设检验多未达标,仅特定模型降低漂移,自然解释信用未证实。

04:00
ArXiv AI

稳健即显著:知情对手将最优信号移至显著性极点

知情对手下稳健最优信号与显著性极点重合,预算增大使最优从后验最大转向边际最大,致对抗意识评估不可区分

04:00
arXiv cs.CL

拒绝可定位,损害却转移:少样本微调下的安全层

少样本微调可移除LLM拒答;定位与修复可被自适应攻击绕过,防御需五项检查。

04:00
arXiv cs.CV

解码灾害:基于视觉语言模型与众源影像的多任务地理空间推理灾害制图

提出GRDisaster框架,融合视觉语言模型与众源影像,实现跨视角地理定位与可解释灾害严重度评估。

04:00
arXiv cs.LG

不确定性感知的强化学习控制自适应三维建图

提出语义熵、曲率与纹理驱动的自适应体素细分,并以强化学习在内存预算下平衡精度与内存,优于基线。

04:00
arXiv cs.CV

查询无关的可变码率视觉令牌编码

查询无关的可变码率视觉令牌编码:保留全部令牌,按率失真优化分配比特,无需文本,同预算下优于均匀编码。

04:00
arXiv cs.LG

恒定内存回忆:固定矩阵状态中的学习关联

固定循环矩阵状态记忆32对键值,准确率99.95%,填充至1798词元仍近乎完美,基线接近随机。

04:00
arXiv cs.AI

懂得何时让步:基于文本的具身智能体中用户纠正的接地仲裁。

GAVA在文本ALFWorld中仲裁用户纠正,选择性核查降本,准确率约98.7%,未证普遍优于澄清。

04:00
ArXiv AI

冲突监督改变的是承诺,而非能力:在约定无关评分下恰好为零的 12.29σ 排列效应

同一语料换序,学习率调度决定顺序效应;恒定率下达12.29σ,但约定无关评分下为零,模型只改承诺不改能力。

04:00
arXiv cs.CV

超越像素重建:面向低资源满文历史文献的检索引导字形感知修复

提出检索引导的字形感知修复框架,为低资源满文历史文献引入字形级结构先验,提升修复质量与字形保真度。

04:00
arXiv cs.LG

面向能源时间序列插补的裁剪感知目标条件化差分隐私扩散模型

面向能源时序缺失插补,提出裁剪感知目标条件化差分隐私扩散模型,以v预测和动态加权缓解梯度裁剪并提升效用。

04:00
arXiv cs.CL

UniBuc 在 SemEval-2024 任务 2:面向临床 NLI 的 Solar 定制提示

未微调 SOLAR Instruct,按临床试验报告章节定制提示,零/少样本,一致性 0.72,排名第 14,模型依赖捷径。

04:00
arXiv cs.CL

面向低资源语言的LLM作为评判者:为罗马尼亚语适配Ragas与比较排序

罗马尼亚语低资源RAG评估:构建AdminRo-Eval,比较三种策略,细粒度分解忠实度达96%,比较排序答案相关性达90%。

04:00
arXiv cs.AI

ContractRL:面向可审计工具调用修复的屏蔽式组相对策略优化

契约约束的JSON顺序修复,经动作掩码与组相对策略优化,以更少token提升修复成功率。

04:00
arXiv cs.CV

面向磁共振成像分割的多分辨率特征融合U-Net

提出MRFF模块嵌入U-Net各层,提升MRI分割精度,两个基准数据集上优于先进模型。

04:00
ArXiv AI

从规则到工具:面向科学计算中大语言模型智能体的可执行检查

R2T将科学需求转为可执行检查;SciCode修复中工具组效果依任务而异,多数提升且影响成本。

04:00
arXiv cs.AI

大语言模型中的数学迁移更取决于推理方法而非主题

多模型实验验证,微调时按推理方法匹配数据比按主题匹配迁移更强。

04:00
arXiv cs.CL

不和谐的芭蕾舞演员与狡猾的胡萝卜:意大利“脑腐”的比较多模态分析

意罗“脑腐”多模态比较,发布240条视频数据集;罗语快剪预测流行,意语文本更负面押韵,声学差异显著。

04:00
arXiv cs.CV

LENS-GRF:用于痤疮严重程度分级与多评估者临床Oracle分析的带门控残差融合的置换不变病变证据网络

提出LENS-GRF,融合置换不变病变集合与门控残差进行痤疮分级,ACNE04准确率达95.89%。

04:00
arXiv cs.CL

规则可摊销,配对不行:语言结构决定潜在任务表征能替代哪些上下文学习

规则性语言操作可摊销为潜在任务表征,零样本匹敌甚至超越ICL;任意配对(如反义词)则无法摊销。

04:00
arXiv cs.CL

大语言模型能否进行长时程推理?面向纵向临床推理的上下文策略实证评估

五种上下文策略中,情节与混合策略准确率最高、远距最稳,近期上下文衰减最快;答对未必能正确弃答。

04:00
arXiv cs.CV

PACT:从视频中端到端学习人体姿态、接触与力

PACT端到端联合学习,从单目视频估计人体姿态、接触与力,结合物理监督与数据标注,性能达最优且泛化。

04:00
arXiv cs.CV

从图像潜空间到模糊规则:胃肠道基础模型的可解释性分析

提出原型模糊规则框架,无需微调即可解释胃肠基础模型特征,精度媲美黑箱方法,并可分析合成医学图像。

04:00
ArXiv AI

JevSpawn:通过组合式动作空间实现自适应智能体推理

JevSpawn将自然语言任务映射为有限概率动作空间,并行生成并反馈筛选动作分支,免训练提升任务表现与速度。

04:00
ArXiv AI

更糟地在一起:多用户多智能体团队中的性能崩坏

多用户多智能体团队共享资源时协调失败,表现普遍逊于单一协调者,出现停滞、互相覆盖与编造行为。

04:00
arXiv cs.AI

JusticeAxis:在刚性规则适用与无根据自由裁量之间基准评测法律裁判

构建18国256起刑案的多模态基准与JusticeAgent,兼顾法条与情节,使开源模型达商用裁判水平。

04:00
ArXiv AI

智能体应当记住什么?在有界记忆评估中解耦留存与检索

构建流式回忆基准:固定访问时查询感知选择提升必需事实回忆率15.5个百分点;有界记忆评估应固定访问、分列留存与选择。