59268 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.AI

PG-SFT:在离线智能体微调中平衡能力获取与保持

PG-SFT按轨迹轮次级信息增益调节监督强度,缓解离线智能体微调中的通用能力退化。

04:00
arXiv cs.CV

VASC:面向高效三维重建的值感知稀疏注意力与跨层记忆

VASC 提出免训练稀疏注意力,融合值感知块选择与跨层记忆,兼顾位姿估计与重建质量,推理最高提速 2.29 倍。

04:00
arXiv cs.CL

AgSpec:突破基于检索的推测解码在编程智能体流水线中的极限

AgSpec为编程智能体补齐检索语料与自适应草稿长度,吞吐最高提升4.76倍。

04:00
arXiv cs.CV

面向重述图像-文本监督分布的匹配预算审计框架

提出匹配预算审计框架,以64词预算五维评估重述图文监督分布,发布约4.9亿审计语料。

04:00
arXiv cs.LG

WIPSNet:用于整夜阻抗呼吸描记图儿科喘息检测的深度学习

提出WIPSNet,利用整夜阻抗呼吸描记的小波尺度图与3D ResNet检测儿童喘息,AUC达0.783,优于EVI等。

04:00
arXiv cs.LG

逻辑与记忆的冲突:浅层 MLP 中的高阶交互学习

单隐层MLP能拟合样本却难还原规则;合成实验表明,优化器与干扰权重学习显著影响高阶交互表现。

04:00
arXiv cs.LG

基于实例学习理论的能量模型中的元认知推理

据实例学习理论提出MERITED,使能量模型按不确定性动态分配算力,并开源1.91亿参数推理模型。

04:00
arXiv cs.AI

面向受控世界模型适配的校准风险路由

提出MC-WM:按拟合/选择/校准划分数据,依标准化校准风险择优适配,在MuJoCo偏移上验证。

04:00
arXiv cs.AI

面向做运筹的AI的运筹学:在OSCAR框架内让LLM沿"扶梯"逐级路由

OSCAR用模拟器、编码器与审阅者逐级调用不同LLM,低成本高准确率地验证并改进优化建模。

04:00
arXiv cs.CL

蒸馏方向性验证

提出方向性标签蒸馏:让冻结教师在其已知方向为候选答案打分,以最优候选作为学生目标,减少错误传递并提升准确率。

04:00
arXiv cs.AI

ActiveSaddler:面向智能体框架优化的自动化课程学习

将课程学习引入智能体框架优化,用赌博机动态发现并排序失败模式,使课程与框架共演化,显著提升通过率。

04:00
arXiv cs.CL

协作技术文档的句子具体性评分:一项领域迁移研究

审计技术文档句子具体性评分,测试生成后评分能否辅助选择LLM修订;效果依预测器与候选集而异。

04:00
arXiv cs.CV

EyeTAG:眼动轨迹感知的注视估计

EyeTAG将近期预测差分主体无关的显式注视轨迹先验,融合人脸与眼流做因果多帧估计,误差降约1°。

04:00
ArXiv AI

VeriHarness:扩展长时程任务的智能体验证能力

VeriHarness把基础模型转为智能体验证器,用分歧消解与共识挑战结合证据筛选并修正结果,五个长时程基准最高提升6.4分。

04:00
arXiv cs.LG

来源识别不等于适应度检验:衡量合成数据溯源的局限

生成文本溯源在改写后准确率骤降;但来源识别与筛选有用数据是两回事。

04:00
arXiv cs.CV

概念驱动的领域自适应:在干草堆中寻找抽象之针

提出三阶段CDDA框架,以概念为语义锚点适配双塔视觉语言模型,实现教学视频概念级检索,优于多个基线。

04:00
arXiv cs.CV

RelationVGGT:面向三维空间关系分割的视觉几何Transformer

RelationVGGT免位姿、免逐场景优化,前馈实现多视图三维空间关系分割,并构建自动标注流程。

04:00
arXiv cs.AI

寻找最佳契合:智能体任务中的模型—框架交互

评估66种模型与框架组合,发现模型排名随框架反转,最佳搭配依任务而变,三者应联合评估。

04:00
arXiv cs.LG

VANDAM:以DNA分子先验视角审视核苷酸序列

VANDAM将DNA分子先验融入基因组基础模型训练,预测区域分子性质,在九项任务上提升性能。

04:00
arXiv cs.AI

ABDA-NL:面向基于论证推理的自然语言场景探索器

为ABDA论证系统加自然语言界面,大模型桥接语言与形式化,判定由确定性引擎完成,修改需用户确认。

04:00
arXiv cs.CL

LawCompass:从法律问答迈向基于证据的多智能体深度研究

提出LawCompass法律助手,集法律问答、专业检索与多智能体深度研究于一体,全程附引用以支撑溯源。

04:00
ArXiv AI

控制论的与认知的:可信智能体委托中缺失的一套词汇

提出智能体委托中控制论与认知语言之分,主张每个关键决策须附第三方可检验的反事实条件。

04:00
arXiv cs.LG

RACE:面向邻域丰富时间序列基础模型预测的残差感知测试时自适应。

提出RACE,利用同域邻居残差进行测试时校正,提升时间序列基础模型预测并支持跨模型门控迁移。

04:00
arXiv cs.CV

注意言辞:基于文本条件的文本感知视频到语音合成

提出WYS框架,以文本条件缓解视觉歧义,用注意力融合与流匹配生成高保真语音,刷新视听同步与准确率。

04:00
arXiv cs.LG

表征跃迁揭示多轮LLM智能体中的新兴安全风险

多轮智能体攻击会在内部表征中留下累积跃迁信号;DART据此检测干预,攻击成功率从84%降至25%。

04:00
arXiv cs.CL

扩展与蒸馏文本嵌入以提升可扩散性

扩展同族文本嵌入并蒸馏T5Gemma-2,以软标签增强潜在空间可扩散性,生成PPL达17.8。

04:00
arXiv cs.CL

以参与奖为探针:随机奖励强化学习作为大语言模型能力探针

随机奖励强化学习可作探针,揭示大模型进一步训练的可达潜力,而非仅当前能力。

04:00
arXiv cs.AI

RISED:面向智能体多环境选择与自蒸馏的评分量规

RISED用行为评分量规引导多环境智能体的数据选择与自蒸馏,提升跨环境表现。

04:00
arXiv cs.CV

扩散多模态大语言模型中的两个时钟:答案在推理解释展开前已稳定

掩码扩散多模态模型中答案可在推理展开前稳定,分块与提示影响覆盖率及准确率,覆盖率是差异主因。

04:00
arXiv cs.LG

EchoPress:通过虚拟上下文重建实现查询无关的 KV 缓存剪枝

EchoPress无需训练,用预填充信息近似重建,仅重建首块校准KV重要性,高压缩率下精度媲美KVzip且开销大降。

04:00
arXiv cs.AI

评估大语言模型生成的偏好分布

大语言模型生成的偏好分布:模型自洽但跨模型差异大,结果更取决于模型选择而非提示措辞。

04:00
arXiv cs.CV

VIEScore2:带空间定位解释的统一图像评估

VIEScore2统一评估图像生成与编辑,单次预测质量分数和缺陷位置,性能优于通用VLM与空间评估器。

04:00
arXiv cs.CL

用任务算子捕捉上下文学习动态

提出任务算子TO,将ICL注意力输出转化为稳定仿射变换,无需完整示例即可逼近其性能。

04:00
arXiv cs.CL

JoinGR:学习遍历连接图以进行表格检索

JOINGR将连接图作为检索空间,以查询条件化遍历边打分,显著提升多跳表格检索召回。

04:00
arXiv cs.LG

更好的分数意味着更好的物理吗?Sim2Real 神经算子的物理基础解释

预测误差低不保证物理统计准确,需以波动能量等物理诊断补充基准评估。

04:00
arXiv cs.LG

NEUROTOKEN:基于条件流匹配的联合声源与方向性听觉注意解码及包络解码

NEUROTOKEN以条件流匹配统一声源、方向性AAD与包络解码,提升源AAD并揭示方向AAD高估。

04:00
arXiv cs.CL

精准胜于规模:一个波兰语—西里西亚语基准及超越开源与商用模型的翻译系统

研究波兰语-西里西亚语翻译,发布SiLTT测试集;规则系统在方言集上最强,微调模型胜神经基线但仍逊之。

04:00
arXiv cs.CV

Video-Index:面向视频理解的精选元基准

提出攻击金字塔审计115个视频基准,构建840项Video-Index,顶尖模型领先开源37个百分点。

04:00
arXiv cs.CL

用工作流进化更好的工作流

FloWright与DataWright以分层奖励实现多角色共进化,数据增难提升小模型多任务表现。

04:00
arXiv cs.AI

关于人工意识,类比能告诉我们什么?

构建因果框架评估类比证据,指出行为相似对人工意识的证据力有限,需建立因果对应。

04:00
ArXiv AI

超越最先进水平:为AI研究标准化环境影响指标

AI研究环境影响报告几近缺失,本文提出标准化可持续性指标与碳排放估算工具,并倡导"最小可行模型"框架。

04:00
arXiv cs.LG

巨型激活的生命周期:随机诞生、权重衰减驱动的增长与竞争性整合

追踪巨型激活的诞生、增长与整合,发现权重衰减因果调控其规模,峰值幅度约随λ的-1/2次方缩放。

04:00
arXiv cs.LG

CommunityKV:基于图划分的高效长上下文解码

将稀疏注意力转为社区检测,从QK^T建token图并划分,局部更新支持流式解码,吞吐最高提升1.71倍。

04:00
ArXiv AI

超越答案置信度:对黑盒决策模型自我知识的受控审计

Jev置信度校准良好,却无法标示知识缺失;边界外新闻高估0.21–0.33,黑盒审计须控制表面线索。

04:00
arXiv cs.CV

利用合成状态过渡自举视频交互生成

用图像编辑模型合成起止状态锚点,提出状态引导采样并构建可扩展交互数据集,微调后显著提升交互生成质量。

04:00
arXiv cs.LG

XOR-Trellis:超低复杂度反量化与曲率感知的无Hadamard变换LLM量化

提出超低复杂度网格反量化器与曲率感知路径优化,无需Hadamard变换即可实现高质量超低位LLM量化。

04:00
arXiv cs.AI

空头承诺:当智能体承诺其运行时无法兑现之事

论文定义"空头承诺":智能体承诺当前轮次后无法执行的动作,并给出失败类型、锚定条件与测量协议。

04:00
arXiv cs.CL

评估日语大语言模型对IME相关错误与打字错误的鲁棒性

评估日语大模型对五类打字错误的鲁棒性:字符换位/替换显著降低准确率,IME、全角及同音转换影响较小。

04:00
ArXiv AI

通过价值引导的信息性搜索提升数学推理

APIVIS将有限预算Gumbel搜索用于块级数学推理,以信息性奖励与选择性监督提升模型数学推理能力。

04:00
arXiv cs.AI

从发现到决策:LLM投票中的有限预算可恢复性

揭示LLM投票固定预算下发现与决策的差距,推导可恢复性阈值与精确锁定证明,实验省28-30%调用并提升准确率。