当数据伪影并非捷径:合成RLVR语料的因果审计
审计合成RLVR语料:可检测伪影未被模型利用,利用差0.021低于对照0.027,代码域几近无信号。
EviGraph:面向时序公共服务知识图谱的携带证明式选择性推荐
区分关键决策需求与可留待未决信息,用语言代理链接时序图谱证据并确定性校验,减少不必要弃答。
分类器的四种生长方式,以及为何其中一种无法学习
四种生长方式中,最自然的分裂叶子加深深度之法因梯度恒为零而无法学习;小随机扰动即可修复。
EurekaBench:衡量智能体发现新科学洞见的能力
新基准EurekaBench含26项跨领域长程任务,评估AI智能体发现科学机制的能力;结果显示其预测精度超人类,但科学洞见提炼明显不足。
CAVE-Mem:面向记忆搜索的边界感知经验验证
CAVE-Mem免训练框架将经验建模为带边界条件的干预算子,匹配时才应用,否则弃权,效果优于纯相关性复用。
EgoRefine:面向异步协同感知的自车参考预测对齐与轨迹条件可靠性感知融合
提出自车参考预测对齐与轨迹条件可靠性融合,缓解异步协同感知特征错位,提升3D检测精度。
DramaAgent:智能体驱动的故事视频生成
提出分层智能体框架,将长视频生成分解为故事规划、角色保持、分场合成与反思修复,提升长篇连贯与音画同步。
面向多专家区间目标的不确定性感知学习
保留多专家区间,分离标签内不精确与专家间差异,匹配预测不确定性;海冰浓度MAE降31%
需要多少类别才够?少样本异常阈值的无分布认证极限
少样本异常阈值认证需大量独立类别,分布无关95%置信下界至少14–59类,证据不足只能失败关闭。
面向风险校准意图路由的有符号词汇置信度
提出有符号词汇门控,融合分类器与稀疏词法证据并校准阈值,降低风险-覆盖曲线下面积,提升意图路由覆盖率。
分布式多智能体委托中的容错预算守恒
分布式多智能体委托的容错预算守恒机制,通过独占托管信用与调度许可,在崩溃、重试、分区等故障下防止超支。
广义生物医学发现
提出广义生物医学发现基准与SCAN方法,通过预测抑制、惊异显著性和互补适应,提升新概念发现并保留已知知识。
评估受控雾退化下反无人机检测的鲁棒性:雾感知训练与晴空性能权衡
首个按雾浓度分级的基准发现,反无人机检测性能随雾非线性骤降,雾感知训练提升全等级但牺牲少量晴空精度。
DuplexSpeechBench-文档接地:语音智能体中文档接地与幻觉的基准评测
语音智能体文档接地基准DSB-DG,含五领域1636问答,评测上下文饱和与接地衰减,级联系统最佳。
低接地分数并不意味着评判器未接地:识别多模态监督中的可感知性混杂因素
视觉接地分数受图像编辑可感知性限制,易误判为无依据;可用审计三量识别误报,并辅以未编辑图像检测上界。
99% 准确率的隐藏代价:电信客户流失基准的可信度审计
基准99%准确率暗藏四类缺陷:SMOTE泄漏虚高F1、冗余特征扭曲SHAP、校准失效、成本阈值被忽视。
确定性不只是正确性:重新思考大语言模型推理中的词元级确定性
确定性更擅长识别问题难度而非区分同题答案对错;信息随词元类型与位置变化,据此分配采样可提升精度并降低成本。
CAST:来自单次前向块草稿器的成本感知投机树
复用块草稿器已评分的候选构建投机树,按验证成本自适应树宽、单次验证,提速最高43%且输出分布不变。
GPEC:用于心脏视频描述生成的高效预LLM高斯过程嵌入校正
GPEC在大语言模型前校正视觉嵌入,提升心脏超声视频描述质量与内容对齐,推理开销低于0.05秒。
基于关联规则算法的乳腺癌分类
乳腺癌高发,本文提出基于关联规则的加权分类算法,含规则生成、剪枝和预测,并在测试样本上验证。
对谁有用?样本价值仅相对于学习器而定义
固定子集、只换学习器:样本相对价值与选择边界随宽度、步幅和架构而变,故须按目标学习器评估选择策略。
Build2SPARQL:面向建筑知识图谱查询的大规模文本到SPARQL基准数据集
提出建筑知识图谱文本到SPARQL大规模基准,含6136条查询、30680个问题,检索增强显著提升准确率。
预测信用:衡量科学解释对实验预测的增量贡献
配对预测评估科学解释的预测增益;预设检验多未达标,仅特定模型降低漂移,自然解释信用未证实。
稳健即显著:知情对手将最优信号移至显著性极点
知情对手下稳健最优信号与显著性极点重合,预算增大使最优从后验最大转向边际最大,致对抗意识评估不可区分
拒绝可定位,损害却转移:少样本微调下的安全层
少样本微调可移除LLM拒答;定位与修复可被自适应攻击绕过,防御需五项检查。
解码灾害:基于视觉语言模型与众源影像的多任务地理空间推理灾害制图
提出GRDisaster框架,融合视觉语言模型与众源影像,实现跨视角地理定位与可解释灾害严重度评估。
不确定性感知的强化学习控制自适应三维建图
提出语义熵、曲率与纹理驱动的自适应体素细分,并以强化学习在内存预算下平衡精度与内存,优于基线。
查询无关的可变码率视觉令牌编码
查询无关的可变码率视觉令牌编码:保留全部令牌,按率失真优化分配比特,无需文本,同预算下优于均匀编码。
恒定内存回忆:固定矩阵状态中的学习关联
固定循环矩阵状态记忆32对键值,准确率99.95%,填充至1798词元仍近乎完美,基线接近随机。
懂得何时让步:基于文本的具身智能体中用户纠正的接地仲裁。
GAVA在文本ALFWorld中仲裁用户纠正,选择性核查降本,准确率约98.7%,未证普遍优于澄清。
冲突监督改变的是承诺,而非能力:在约定无关评分下恰好为零的 12.29σ 排列效应
同一语料换序,学习率调度决定顺序效应;恒定率下达12.29σ,但约定无关评分下为零,模型只改承诺不改能力。
超越像素重建:面向低资源满文历史文献的检索引导字形感知修复
提出检索引导的字形感知修复框架,为低资源满文历史文献引入字形级结构先验,提升修复质量与字形保真度。
面向能源时间序列插补的裁剪感知目标条件化差分隐私扩散模型
面向能源时序缺失插补,提出裁剪感知目标条件化差分隐私扩散模型,以v预测和动态加权缓解梯度裁剪并提升效用。
UniBuc 在 SemEval-2024 任务 2:面向临床 NLI 的 Solar 定制提示
未微调 SOLAR Instruct,按临床试验报告章节定制提示,零/少样本,一致性 0.72,排名第 14,模型依赖捷径。
面向低资源语言的LLM作为评判者:为罗马尼亚语适配Ragas与比较排序
罗马尼亚语低资源RAG评估:构建AdminRo-Eval,比较三种策略,细粒度分解忠实度达96%,比较排序答案相关性达90%。
ContractRL:面向可审计工具调用修复的屏蔽式组相对策略优化
契约约束的JSON顺序修复,经动作掩码与组相对策略优化,以更少token提升修复成功率。
面向磁共振成像分割的多分辨率特征融合U-Net
提出MRFF模块嵌入U-Net各层,提升MRI分割精度,两个基准数据集上优于先进模型。
从规则到工具:面向科学计算中大语言模型智能体的可执行检查
R2T将科学需求转为可执行检查;SciCode修复中工具组效果依任务而异,多数提升且影响成本。
大语言模型中的数学迁移更取决于推理方法而非主题
多模型实验验证,微调时按推理方法匹配数据比按主题匹配迁移更强。
不和谐的芭蕾舞演员与狡猾的胡萝卜:意大利“脑腐”的比较多模态分析
意罗“脑腐”多模态比较,发布240条视频数据集;罗语快剪预测流行,意语文本更负面押韵,声学差异显著。
LENS-GRF:用于痤疮严重程度分级与多评估者临床Oracle分析的带门控残差融合的置换不变病变证据网络
提出LENS-GRF,融合置换不变病变集合与门控残差进行痤疮分级,ACNE04准确率达95.89%。
规则可摊销,配对不行:语言结构决定潜在任务表征能替代哪些上下文学习
规则性语言操作可摊销为潜在任务表征,零样本匹敌甚至超越ICL;任意配对(如反义词)则无法摊销。
大语言模型能否进行长时程推理?面向纵向临床推理的上下文策略实证评估
五种上下文策略中,情节与混合策略准确率最高、远距最稳,近期上下文衰减最快;答对未必能正确弃答。
PACT:从视频中端到端学习人体姿态、接触与力
PACT端到端联合学习,从单目视频估计人体姿态、接触与力,结合物理监督与数据标注,性能达最优且泛化。
从图像潜空间到模糊规则:胃肠道基础模型的可解释性分析
提出原型模糊规则框架,无需微调即可解释胃肠基础模型特征,精度媲美黑箱方法,并可分析合成医学图像。
JevSpawn:通过组合式动作空间实现自适应智能体推理
JevSpawn将自然语言任务映射为有限概率动作空间,并行生成并反馈筛选动作分支,免训练提升任务表现与速度。
更糟地在一起:多用户多智能体团队中的性能崩坏
多用户多智能体团队共享资源时协调失败,表现普遍逊于单一协调者,出现停滞、互相覆盖与编造行为。
JusticeAxis:在刚性规则适用与无根据自由裁量之间基准评测法律裁判
构建18国256起刑案的多模态基准与JusticeAgent,兼顾法条与情节,使开源模型达商用裁判水平。
智能体应当记住什么?在有界记忆评估中解耦留存与检索
构建流式回忆基准:固定访问时查询感知选择提升必需事实回忆率15.5个百分点;有界记忆评估应固定访问、分列留存与选择。
基于正例-未标注数据的部分AUC最大化
提出无需负例、仅用正例和未标注数据最大化部分AUC,推导估计器训练分类器,十个真实数据集验证有效。