62302 条条目 · 106 个活跃源
2026年9月24日
04:00
ArXiv AI

CogenPVG:面向说服性视频生成的认知增强反思式多智能体框架

提出CogenPVG框架,将说服性视频生成分为四阶段,结合ELM理论用生成-评论双智能体迭代优化,说服效果最佳。

04:00
arXiv cs.AI

Video-HopChain:面向视频推理模型的多跳问题与置信度门控探索

构建多跳视频问答数据集,两阶段GRPO训练提升八基准,提出置信度门控探索使均分达59.3。

04:00
arXiv cs.AI

MorphoSHAP:重新思考深度视觉模型解释中的归因单元

MorphoSHAP以形态学形状为Shapley归因单元,解释证据位置、结构类型与贡献强度,性能与用户偏好均优。

04:00
arXiv cs.CL

COMED:多LLM推理中路由与协作之间缺失的中间地带

揭示跨模型协作的非单调性,COMED以锚点自洽、路由边距与轻量探针选择性升级协作,在16项基准上最多提升10.7个百分点且更省算力。

04:00
arXiv cs.CL

当学习式上下文规划未能胜过强检索:面向长上下文问答的规划、路由与重排序对照研究

受控实验表明,学习式上下文规划经强检索、路由与重排序控制后仍不及混合检索,只是弱相关信号。

04:00
arXiv cs.CL

专家在LLM分歧处登场:利用跨模型分歧定位专家投入,改进大规模标注的LLM编码手册修订

以LLM跨模型分歧定位专家投入;理由标注法准确率64.9%,优于专家修订手册,将数月修订缩短至数天。

04:00
arXiv cs.CL

事实核查得分提升时究竟改变了什么?训练验证器与大语言模型中的证据与答案归因

联合分数提升主要来自证据改善而非答案准确率;扩大上下文可放大证据增益,聚合指标会掩盖声明级差异。

04:00
arXiv cs.CL

句子级解释准则分类:来自德国联邦宪法法院的基准

基于德国联邦宪法法院判决,构建句子级解释准则分类基准;四模型七项子任务平均F1为70.4–79.2。

04:00
arXiv cs.LG

面向机器学习聚合物性质预测的开放基准

发布PolyBench26开放数据集,涵盖近25万条、八种性质的聚合物数据,支持四类评测任务;结果显示图模型预测误差最低,且在不同训练规模与重复单元复杂度下均保持稳健。

04:00
arXiv cs.CV

从温室气候到单叶:一种器官分辨的生菜生长模型

构建器官分辨生菜生长模型,逐叶模拟光合与三维结构互作,干重预测误差9.5%,支撑温室数字孪生决策。

04:00
arXiv cs.LG

论多目标强化学习中事后重标记引发的偏好覆盖坍缩

多目标强化学习按实际达成偏好做事后重标记会致偏好覆盖坍缩,损害多数设置;her_mix 单参数凸组合可将多数恢复至基线。

04:00
arXiv cs.CL

LEGO:协同专家GraphRAG与专家思维链进行法律推理

LEGO融合法律专家GraphRAG与专家思维链,借规范关系检索和结构化推理提升大模型法律推理能力。

04:00
arXiv cs.CL

能识别却无法生成:面向文化特定亲属称谓的生成基准

多选高分但生成低分:五种开源LLM在印地、泰米尔、韩语亲属称谓生成中准确率骤降,需生成式评估。

04:00
arXiv cs.CV

面向成本高效空间转录组学的主动位点选择基准测试

空间转录组主动选点基准显示:小预算下主动策略未稳定优于随机采样,且排序依赖评价指标。

04:00
arXiv cs.LG

后处理公平性约束何时有益、何时有害:来自八项跨域评估的证据

FAPE跨八领域评估:后处理公平约束在高基线差异时多改善、近公平时反恶化;单次审计不可靠,需持续监控。

04:00
arXiv cs.LG

CORE-STACK+:面向深度堆叠泛化的元学习

CORE-STACK+缓解异构视觉堆叠的共线性与校准崩溃,多基准提升且降模型量与算力。

04:00
arXiv cs.CV

记忆抹除:人脸识别模型嵌入空间中的对抗性选择性身份遗忘

提出开放集对抗遗忘,用三种损失微调人脸识别嵌入空间,使选定身份不可链接且不影响其余人群。

04:00
arXiv cs.CV

MINER:面向冻结双编码器的稀有物体检索多裁剪推理增强

免训练MINER用区域嵌入与相似度重打分增强冻结双编码器,提升杂乱场景稀有物体检索并发布ROCS基准。

04:00
arXiv cs.CL

伊利诺伊社会态度聚合语料库(ISAAC):用于大规模分析社会群体话语的开放工具与可复现流程

推出ISAAC:5.27亿条Reddit帖子,覆盖六类社会群体,支持标注、验证与可复现分析。

04:00
arXiv cs.CV

基于自适应分层集成学习与不确定性估计的太阳磁图超分辨率

以图像复杂度分层训练专家网络集成,配轻量路由与不确定性估计,实现MDI到HMI磁图超分辨。

04:00
arXiv cs.CV

PEARL:面向实时、匿名与异构协同感知的轻量级提示式特征解释器框架

提出PEARL轻量提示式框架,以双多尺度解释器实现匿名、实时异构协同感知,免共享配置,提精度降通信。

04:00
arXiv cs.CL

EduBehaviors:面向教育对话可审计编码的基于断言模式

提出EduBehaviors框架,用大模型测量可观察行为并训练分类器,实现可解释、可扩展、可审计的教育对话标注,在TalkMoves上具竞争力,并开源工具。

04:00
arXiv cs.LG

CRISP:面向不平衡表格学习的可扩展重要性分层核心集

线性时间核心集法:按代理分数分层分配负类预算并逆倾向加权,生产数据减95%负类仍保99.7%精度。

04:00
arXiv cs.CV

面向手术的层次感知视频-语言模型评估与双曲基线

提出层次感知评测基准与双曲基线模型,揭示同准确率下错误严重度差异,双曲几何可提升预测的层次一致性。

04:00
arXiv cs.LG

TinyUDE:在微控制器上通过李-泰勒射流匹配实现无求解器通用微分方程

提出无求解器李-泰勒射流匹配,可在微控制器上实时低内存训练通用微分方程,精度媲美或超过求解器基线。

04:00
arXiv cs.LG

GeoRVQ:生理信号残差 token 预测中的解码器感知几何

GeoRVQ以解码器感知几何软目标改进生理信号残差量化掩码建模,提升解码保真度与R峰检测。

04:00
arXiv cs.CV

设计即多样:面向原型可解释性的架构约束

提出DAPL,以一对一注意力映射的架构约束强制原型多样性,结合前景感知训练与覆盖度、多样性量化指标。

04:00
arXiv cs.CV

面向高速公路交通监测的路侧基础设施雷达系统系统性评估

发布DRaT数据集,评估路侧雷达:检测精度受限,跟踪可靠,速度估计准,密度流量低估23%。

04:00
arXiv cs.LG

资源高效的分布式递推高斯过程

提出两种分布式递推高斯过程算法,分析收敛性并优化参数,实测显著降低通信量且精度相当。

04:00
arXiv cs.CL

LexLattice:通过文档层级上的神经细胞自动机实现多语言抽取式摘要

将法律文档层级映射为二维语义晶格,用神经细胞自动机整合证据,实现多语言抽取式摘要,24语种SOTA。

04:00
arXiv cs.LG

WTF?!基于Wasserstein倾斜流映射的无仿真强化学习

提出WTF框架,用Wasserstein倾斜流映射实现无仿真强化学习微调,少步推理即保持高奖励,训练算力最多省280倍。

04:00
arXiv cs.CV

面向遥感变化检测的时序有序区域Token Mamba与Logit空间扩散

提出BMD-CD,融合时序有序Mamba与Logit空间扩散,实现高精度、强边界、高效的遥感变化检测。

04:00
ArXiv AI

面向有限集多模态轨迹预测的目的地支撑恢复

提出DSR后选择算子,无需重训或扩大集合,修复目的地支撑并重分配冗余假设,显著降低预测误差。

04:00
arXiv cs.AI

CricRAG:面向个性化板球训练的检索增强视觉语言模型

以检索相似但更优的动作为参考,为板球选手提供契合自身水平的个性化反馈,专业评估一致率达94%。

04:00
ArXiv AI

Skytopia:基于动作条件潜在世界模型的单目无人机导航

Skytopia用动作条件潜在世界模型预测表征,单策略支持三类导航,成功率66%,实机零微调部署。

04:00
arXiv cs.LG

限电导致数据稀缺下的太阳能光伏发电预测:基于共形化分位数回归的迁移学习

迁移学习结合共形分位数回归,限电致数据稀缺下光伏预测RMSE降23.7%,经验覆盖率达94.3%。

04:00
arXiv cs.AI

BAS-OPD:面向细粒度多模态感知的预算感知选择性同策略自蒸馏

BAS-OPD按预算选择性分配教师监督,仅改训练分配、保持单次全图推理,以更低成本提升细粒度多模态感知。

04:00
ArXiv AI

迈向负责任的AI增强网络防御:模式识别、纵深防御与人机协作的理由

构建形式模型量化AI增强纵深防御与人机复核权衡,证明全量人工复核非最优,提出SOC内点最优容量比。

04:00
ArXiv AI

互惠协作:GLAM机构融合的经验如何助推跨学科AI研究

AI跨学科合作常沦为单向服务,本文借鉴GLAM融合经验,提出互惠协作模式与五项关键实践。

04:00
ArXiv AI

SE-MSB:基于 Mamba 薛定谔桥的端到端非配对语音增强

提出完全非配对语音增强框架,用Mamba薛定谔桥端到端处理波形,性能媲美或超越基线,推理快数个数量级。

04:00
ArXiv AI

从声明损失与可达状态编译充分治理上下文:具基数与成本目标的精确观测契约合成

合成充分观测契约,区分必要属性与联合充分集,按基数或成本择优;实验显示核心不充分、成本可平局,求解器远快于枚举。

04:00
ArXiv AI

REVE:通过复用编码器状态实现大型音频语言模型的高效幻觉校正

REVE复用目标模型已算的编码器状态验证音频事件提及,无需二次编码,消除92.9%无支撑提及,延迟仅CED-Base的1/18。

04:00
ArXiv AI

EMERGE:基于等变图扩散的分辨率无关点云生成

提出首个完全SE(3)等变图扩散点云生成骨干,支持任意分辨率零样本推理,质量SOTA且收敛更快。

04:00
arXiv cs.CL

NADI 2026:第二届多方言阿拉伯语语音处理共享任务

NADI 2026设五项八子任务,覆盖ASR、方言识别、TTS、翻译与理解;域外泛化仍是瓶颈。

04:00
arXiv cs.LG

线性表示假设需要一个群作用

线性表示假设实为按表示等价性区分的一族命题,可用群作用形式化表示对象、生成过程与断言性质。

04:00
arXiv cs.LG

训练好的GNN中的局部证据与几何读出修复

线性规划分离GNN误差来源,重加权与平移修复可提升准确率,平移贡献更大;局部证据难选,放宽约束更有效。

04:00
arXiv cs.CV

视觉语言模型看似的能力极限,实为读出极限

视觉语言模型评测中答案格式并非中性;看似能力不足常是读出限制,甚至会改变模型排名。

04:00
arXiv cs.CV

学习关节运动约束下的单目视频手术运动学

提出单目视频手术器械运动学重建网络,估计位置、姿态与钳口角,Open-H上降低路径误差并提升运动分割精度。

04:00
arXiv cs.LG

大型推理模型推理阶段的能力与效率扩展

评估推理模型发现:规模扩大带来能力收益递减,推理效率几乎无提升。

04:00
arXiv cs.CL

数证据,而非数句子:面向长文本价值测量的LLM判断退火证据融合

提出免训练TEF,按信息增益加权句子证据、抑制不确定句,在MIND基准上平均提升4.5个准确率点。