59269 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.CV

孟加拉语转写段落中的颜色无关词分割

面向手机拍摄手写孟加拉文,构建含阴影干扰数据集,实现颜色无关词分割,F1达91.2%。

04:00
arXiv cs.LG

让稀疏奖励发挥作用:面向多奖励强化学习的密度感知奖励聚合

提出DARA,依活跃组密度反比加权聚合多奖励,加速工具调用与数学推理学习。

04:00
arXiv cs.CV

CineMR:面向定量心脏磁共振评估的工具集成视觉语言推理

CineMR以工具增强视觉语言推理,调用分析工具完成定量Cine CMR评估,显著优于现有模型。

04:00
arXiv cs.CV

RSNA颅内动脉瘤(RSNA-ICA)数据集

RSNA联合多学会发布RSNA-ICA大型公开数据集,含4278例患者的7202个CTA、MRA及MRI序列,用于AI颅内动脉瘤检测与定位。

04:00
arXiv cs.AI

声誉、策略与情绪对生成式AI合作的影响:推理模型与非推理模型的比较

声誉、策略与情绪共同影响生成式AI合作;推理模型更倚重策略与声誉,情绪作用更具条件性,末轮行为各异。

04:00
arXiv cs.CV

基于语义RGB-Depth的显微立体视频手术技能评估

融合立体与单目深度的语义RGB-Depth框架,结合器械与解剖语义流及层次注意力,实现显微立体视频手术技能评估,F1达0.938。

04:00
arXiv cs.LG

随机递归模型

提出随机递归模型RRM,从层池随机采样执行递归,参数更少,性能匹配或超越基线,推理时可调深度并提升表现。

04:00
arXiv cs.CL

ARCCS:自动化监管合规检查系统

首个开源端到端合规检查系统,分解条文并凭证据评估;GDPR一致率96.67%,采购违规检出98.8%。

04:00
arXiv cs.CV

OptimusMesh:通过稀疏潜在枢轴从点云生成紧凑自回归网格

OptimusMesh将点云压缩为16个稀疏潜在枢轴,两阶段自回归直接生成紧凑三角网格,面数减少25.7%–94.1%,几何保真度具竞争力。

04:00
arXiv cs.LG

基于训练动力学动作的一步生成建模

TDAction按共享参数实现代价选择传输目标,兼顾分布进展,ImageNet无蒸馏FID<1.1。

04:00
arXiv cs.AI

联邦智能体优化

提出联邦智能体优化,使分布式智能体在保留本地隐私数据下受控交换信息、协作提升,并平衡效用、隐私与通信成本。

04:00
arXiv cs.LG

SimplexUQ:面向单纯形值预测的共形不确定性评估框架与基准

首个单纯形值预测共形不确定性基准,用12项任务比较现有包装器的覆盖分配,揭示全局校准不均且无普适最优。

04:00
arXiv cs.CL

评估面向纵向临床笔记的大语言模型问答中的生物医学重排序

生物医学重排序提升临床笔记检索Hit@10(46.6%→60.6%),答案正确率仅微增至48.6%

04:00
arXiv cs.CL

什么能赢得一票?法国Compar:IA大语言模型竞技场中的格式、长度与词汇多样性

13.7万法语投票:格式、长度与词汇多样性影响胜负;调整排名变动大却未更准,宜并列原始与调整排名。

04:00
arXiv cs.LG

在线非单调DR子模最大化的几何相关界

研究在线非单调DR子模最大化,给出几何相关上下界,将系数提升至4/9,并刻画最优缺口。

04:00
arXiv cs.CL

AI 生成的科学文本是否遵循人类论证模式?——基于 CARS 模型的研究论文引言对比

人类写的研究引言在论证步骤的选择与顺序上更灵活,AI 生成文本更统一;给出 CARS 定义后 AI 反而更僵化。

04:00
arXiv cs.LG

冗余遇见协同:基于子模优化的MoE依赖感知专家选择

提出DS-MoE,以差子模优化实现MoE依赖感知专家选择,平衡冗余与协同,性能优于基线。

04:00
arXiv cs.CL

面向本体网络构建的LLM辅助类型化语义链接发现

结合嵌入聚类预筛与GPT-4o提示生成类型化语义链接,80万概念对缩至9.5万,精度80.19%。

04:00
arXiv cs.CL

正确答案,错误状态:多智能体协作中的隐藏信息失效

多智能体协作常以答案正确为成功,却忽视信息状态损坏;证据验证与状态重建远低于任务解决,所提方法可改善。

04:00
arXiv cs.CL

SHAMS:面向黎凡特阿拉伯语的音频锚定发音基准

SHAMS:覆盖五种黎凡特阿语变体的1300条语音基准,四层对齐,支持发音与语音识别评测。

04:00
arXiv cs.CV

AutoGUIWorld:将图像生成器作为GUI智能体的视觉世界模型

无需部署软件,用图像生成器与规划器合成GUI交互轨迹,微调后显著提升OSWorld与ScienceBoard任务表现。

04:00
arXiv cs.AI

ProtoFlow:用于多变量时间序列预测的原型引导流匹配

ProtoFlow以VQ码本为原型先验,用DiT修正流实现高效非自回归多变量时间序列预测,性能领先。

04:00
arXiv cs.CL

什么让事物变得更难?用自然语言解释问题难度

从大模型回答中估计题目难度,自动生成并验证自然语言假设,解释题目为何更难,预测力强且具因果性。

04:00
arXiv cs.CV

EgoFound3R:基于逐点交互属性的端到端世界空间第一视角手部重建

EgoFound3R 以端到端统一模型在世界空间重建第一视角手部几何,并同程预测逐点可见性、接触与距离,精度显著提升、吞吐约 6 倍。

04:00
arXiv cs.AI

学习提问:预算约束下面向SLM-LLM协作的信息获取

将SLM-LLM协作建模为预算受限的信息获取:SLM按需向黑盒LLM发问,三阶段RLVR学习何时调用、如何提问与整合,优化性能成本权衡。

04:00
arXiv cs.LG

ORBIT-FMIB:通过ESM-2追踪按阶数解析的上位性信息

ORBIT-FMIB用Walsh分解与神经依赖估计,探测ESM-2各阶上位性信息;复现显示高阶保留差异不稳健,结论未定。

04:00
arXiv cs.CL

审计规则如何塑造大语言模型中忠实的因素解释

报告依赖型审计会激励大语言模型隐瞒重要因素,加入报告无关的审计成分可促使其如实汇报。

04:00
arXiv cs.LG

MIKASA-Robo-VLA:面向长时程操作的VLA模型记忆能力基准测试

VLA长时程操作记忆基准:90任务多隐藏线索,28个信息间隙超16帧,2.25万条轨迹,基线成功率0.211。

04:00
arXiv cs.AI

无需等待的反馈:在大型数学课堂中试点生成式AI练习平台

设计生成式AI练习平台,在大型数学课中即时提供支架式反馈,将人工监督前移至答案预先核验。

04:00
arXiv cs.AI

DeFA:面向LLM智能体的依赖引导式故障归因

DeFA以事件依赖图与故障传播图定位智能体决定性错误,多项基准达最优,其诊断反馈还能提升下游任务精度。

04:00
ArXiv AI

面向动态推理的修订感知独立智能体图

提出RIAG多智能体策略,分离时间解析与推理,缓存并条件审计修复,动态路由准确率显著优于基线。

04:00
arXiv cs.AI

面向智能交通系统与物流的可信数据运维与机器学习运维

综述智能交通与物流领域的可信DataOps与MLOps,探讨其工具、案例、AI可信方法及未来挑战。

04:00
arXiv cs.CL

人格设定仍在,但究竟是谁在说话?持久化AI智能体中的潜在身份回退

失去系统人格锚定后,常驻智能体可潜在回退为底层身份;历史仍含人格却未必践行,需锚定与对话维持。

04:00
arXiv cs.LG

重尾噪声下的线性系统学习:基于单条轨迹的非渐近分析

重尾噪声下,基于单条轨迹给出指数稳定线性系统最小二乘估计的非渐近误差界,并推广至次高斯与次指数噪声。

04:00
arXiv cs.LG

右对齐原地(RiP)卷积:一种简单、通用且近最优的内存高效CNN推理策略

提出RiP卷积,纠正并泛化原地卷积,近最优省内存,峰值激活内存降12.5%–33.3%且输出不变。

04:00
arXiv cs.CL

第二个模型何时有帮助?LLM验证中的跨模型审查

跨模型审查与同模型F1无显著差异,发现错误部分不同;同模型加跨模型优于两次同模型,但未显著优于强跨模型两次。

04:00
arXiv cs.AI

SCOPE-AD:面向诊断智能体的基于能量模型的序贯成本感知序数信念规划

SCOPE-AD用能量模型规划成本感知序贯检查,在ADNI以50.46美元成本达77.70% Macro-F1,超基线9.34个百分点。

04:00
arXiv cs.LG

学习恒等映射:SGD 如何选择函数分解的案例研究

深度线性残差网络学恒等映射时,SGD偏好特定层分解而非零权重;熵损失可解释,重参数化改变结果

04:00
arXiv cs.CV

一种面向动态场景的紧凑显式4D表示

提出Sparc4D,将单目视频编码为稀疏4D状态,压缩动态特征,重建质量优且紧凑,可迁移。

04:00
arXiv cs.AI

DAYJOB:长周期专业工作基准测试

DAYJOB 基准涵盖医疗与金融共130项长周期专业任务,最强模型通过率约24%,中位配置不足3%。

04:00
arXiv cs.CL

GAW-PO:基于梯度对齐词元权重的偏好优化

GAW-PO按梯度对齐度重新加权被拒词元的负向惩罚,在11项基准上超越DPO,且对强偏好优化更稳健。

04:00
arXiv cs.CL

对 WebArena-Lite 上网络智能体评估的审计:对结果与轨迹的人工复核

人工复核165项任务,纠正自动评估漏判5–8个百分点,发现滚动循环等失败模式,最终分数不足以评估智能体。

04:00
arXiv cs.AI

问卷引导的家庭智能电表数据电器用电分解

提出问卷引导的无标签分解系统,将智能电表数据分为9类电器,在多数据集上误差最低,并给出节能建议。

04:00
arXiv cs.CV

基于动态归航优化的三维网格生成流匹配强化学习

提出动态归航优化DHO,将负轨迹优化转为正样本吸引引导归航,构建Flow3D-Pro提升3D网格生成质量。

04:00
arXiv cs.LG

探索更多,推理更佳:面向扩散语言模型的逐步风险敏感GRPO

提出StepRS-GRPO,随去噪状态调整风险系数,提升扩散语言模型数学推理准确率、覆盖率和多样性。

04:00
arXiv cs.LG

低损失区域错位导致Grokking

本文提出低损失区域几何框架,发现训练与验证的低损失区域错位导致Grokking,并给出反例。

04:00
arXiv cs.CV

STAGE:面向文本到3D模型的子空间靶向仿射生成擦除

免训练闭式分阶段文本到3D模型概念擦除:按类型校正结构/外观,TRELLIS得分66.7胜53.2。

04:00
ArXiv AI

ITC-MoE:面向MoE扩散语言模型的重要性引导Token感知压缩

提出ITC-MoE,结合重要性引导Tucker压缩与Token感知补偿路由,降低MoE扩散语言模型开销并保持生成质量。

04:00
arXiv cs.LG

群不变统计决定嵌入几何:从巴赫到夜空的表示调和分析

群不变共现统计决定嵌入几何:表示由不可约表示矩阵元构成,统一解释月环、五度圈与天体球谐。

04:00
arXiv cs.CL

无需模型:文本熵率过滤缓解迭代微调坍缩

无需模型,文本熵率过滤缓解迭代微调坍缩:六代实验显著提升合成数据多样性、降低重复,优于对数概率过滤。