61263 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.AI

CADOC:面向长时程智能体的缓存感知动态对象上下文

CADOC批量替换上下文对象为卡片,保留按需检索,输入成本降约40%,性能接近全上下文。

04:00
ArXiv AI

神经符号计算机使用:学习可复用策略以实现可靠高效的执行

提出神经符号计算机使用,将重复工作流固化为可复用策略,神经模型处理依赖观测的决策,大幅降本增效。

04:00
arXiv cs.CV

MotionInsight:诊断生成视频中的物体运动缺陷

提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。

04:00
arXiv cs.AI

首个面向交通信号控制的视觉-语言-动作模型

首个基于视觉-语言-动作模型的端到端交通信号控制方法,直接从多视角路侧视频映射为协调信号动作。

04:00
arXiv cs.CV

NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子

NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。

04:00
ArXiv AI

双通道鲁棒群相对策略优化:基于优势与序列权重估计

提出双通道鲁棒优化器RoVR-GSPO,以有界残差信用与SoftRoVR聚合稳健估计优势和序列权重,抗奖励污染与比率异常,优于GSPO。

04:00
arXiv cs.AI

CoEM:以证据确认记忆赋能长上下文推理

CoEM暂存原文证据,随新上下文决定提升、保留或丢弃,经验证器校验,强化学习训练,提升长上下文推理。

04:00
arXiv cs.CV

OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型

提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。

04:00
arXiv cs.AI

SCA:面向GUI智能体强化学习的空间信用分配

提出SCA,用点击坐标细化组相对信用,提升GUI智能体定位与动作预测,部署策略不变。

04:00
arXiv cs.CV

Real2Gym:从视频构建仿真训练场,让机器人获得技能

提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。

04:00
arXiv cs.CV

无承诺的上下文:非刚性变形下的鲁棒稠密对应

CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。

04:00
arXiv cs.CV

Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理

无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。

04:00
ArXiv AI

CF-LoRA:解耦因子聚合与适应感知客户端聚类用于联邦LoRA微调

CF-LoRA通过解耦因子聚合与适应感知聚类,解决联邦LoRA微调的聚合与协作不匹配,提升异构数据下的精度。

04:00
arXiv cs.AI

REALHOP:以行为审计重新审视多跳推理评估

提出行为必要性率(BNR):答案正确≠多跳推理;REALHOP将BNR从27.4%升至94.4%。

04:00
arXiv cs.CV

GleanVID:面向高效视频大语言模型的互补Token选择

GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。

04:00
arXiv cs.LG

为了规划,世界模型必须区分什么?

规划无需保留全部物理差异;需保留什么取决于查询、候选集与规划器;建议查询定搜索、动作模型预测的模块化设计。

04:00
arXiv cs.CL

FactorEngram:面向语言模型的基级门控因子化 N-gram 记忆

提出因子化n-gram记忆:以共享基向量字典检索稀疏系数,并用基级上下文门控逐分量调制,提升语言建模与下游性能。

04:00
arXiv cs.CL

谁在谁的左边?追踪相对位置推理中的空间证据与角色绑定

揭示相对位置推理中空间追踪与角色绑定两组件,干预内部表征可提升模型准确率与配对一致性。

04:00
arXiv cs.CV

UniBuild: Unified Building Mapping From Multi-Source Optical Remote Sensing Imagery With Detail Decoding and Geometry Regularization

04:00
arXiv cs.LG

未知链接下的低秩单指标赌博机:从矩阵到张量

研究未知链接与低秩指数的矩阵/张量赌博机,T-ESTOR和T-BSTOR分别在单调与非单调链接下达到最优遗憾率。

04:00
arXiv cs.LG

卢卡西维茨神经网络扩展:面向可解释规则提取的残差架构与结晶策略

残差连接将卢卡西维茨网络扩展至任意深度并保持合并神经元符号对应;分析三种结晶策略以促进可解释规则提取。

04:00
arXiv cs.AI

ImbalancE:应对链接预测中度数不平衡的推理时隐空间搜索

提出推理时隐空间搜索,缓解链接预测中度数不平衡偏差,提升最不平衡三元组预测。

04:00
arXiv cs.LG

面向矩阵优化器中自适应 Newton–Schulz 的零开销谱估计

用牛顿–舒尔茨迭代中的格拉姆矩阵谱矩,无额外矩阵乘法即可估计奇异值谱,自适应选择多项式,降低正交化误差。

04:00
arXiv cs.CL

少些谄媚,更强拒绝?机制可解释性对AI安全的启示

机制可解释性表明:降低谄媚不保证直接拒绝更强,但能在用户施压下恢复部分拒绝能力。

04:00
arXiv cs.LG

平衡早期性能牺牲与长期收益:跨训练时长缩放学习率预热时长

预热时长应随训练时长与峰值学习率缩放,短训练拟合可预测长时训练最优预热。

04:00
arXiv cs.CV

LDM-is-AE:潜在扩散模型是用于端到端图像生成的自编码器

提出LDM-is-AE,将潜在扩散模型自身视为自编码器,端到端联合学习潜表示与去噪,无需独立分词器,FID达1.80/1.90。

04:00
arXiv cs.LG

生成模型增强推荐系统相关的算法危害

论文扩展算法危害分类体系,涵盖生成模型增强推荐引发的新型表征、服务质量与内生危害,并作因果分析。

04:00
arXiv cs.CL

超越词元规模:面向可靠语义特征发现的块级稀疏自编码器

提出块级稀疏自编码器,以分块均值激活学习可靠语义特征,提升检索、推理检测与引导。

04:00
arXiv cs.CL

自发的上下文恢复:语言模型如何从损坏输入中恢复

语言模型可自发从损坏输入恢复;恢复分两阶段,隐藏状态可预测失败,探针AUC约0.78,适度损坏微调增强鲁棒性。

04:00
arXiv cs.LG

SketchSSM:写入完整状态,从紧凑草图读取

SketchSSM通过缓存基向量输出构建紧凑草图,避免解码时全状态读取,状态访问流量减少约10倍,内核加速最高7.78倍。

04:00
arXiv cs.CL

ALMIEYAR:面向多方言阿拉伯语语音识别的文化根基型基准

覆盖17种阿拉伯方言、13.7小时录音,评测12个ASR系统,最佳WER仍达35%,首建阿瓦兹方言基准。

04:00
arXiv cs.LG

意大利儿童语音音素识别的深度学习技术

Broca仅用不足3小时意大利儿童语音微调,音素错误率达13.36%,助力低资源临床语音评估。

04:00
arXiv cs.CL

混合注意力大语言模型中的多语言性

首次研究混合注意力对LLM多语言性的影响:跨语言表示随层序变化,调整层序可使训练提速2.5倍。

04:00
arXiv cs.CL

AwarenessBench:评估语言模型的认知能力

首个语言模型认知能力基准AwarenessBench,含四维度15项功能。18个模型均超随机基线,最佳者总体胜人类均值,但元认知与自我意识仍落后,认知独立于推理进步。

04:00
arXiv cs.LG

DevelopmentODE:面向十年间早期脑发育动态的结构化神经常微分方程

提出结构化连续时间模型,融合群体轨迹与个体差异,能从稀疏纵向fMRI预测儿童脑发育,长短时程均优于基线。

04:00
arXiv cs.CV

盲区中的速度:自动驾驶视觉语言模型动态感知的可解释性分析

VLM车速理解存盲区:潜表征可解码却难表达,时序利用弱,专用模型仍有差距;规划合理≠状态可靠。

04:00
arXiv cs.CL

AraDynFact:阿拉伯语事实知识的动态评估

提出AraDynFact动态框架,基于阿拉伯语维基百科自动评测大模型事实知识,并与人工基准高度相关。

04:00
arXiv cs.LG

基于边界动力学的零存储程序化神经合成:Lean 4 形式化验证与裸机严苛测试验证

提出WERR/OED零存储程序化神经合成,以24字节种子沿Mandelbrot边界生成决策;Lean 4验证10条定理,EVM gas≤22557,无VRAM,达15397决策/秒。

04:00
arXiv cs.CL

TRACE:面向生成校准的单次解码轨迹风险定位

TRACE将解码时不确定性视为轨迹,记录token意外度与熵,用局部风险算子保留尖峰并转为答案级置信度;TRACE+校准后在四任务上降Brier、升AUROC。

04:00
arXiv cs.CV

NRF-GS:面向高表达力与紧凑高斯泼溅的神经残差场

以共享全局神经残差场替代逐高斯球谐,增强视角相关反射建模,高斯数量减少50%仍保持或提升渲染质量。

04:00
ArXiv AI

AnyAct:面向自进化智能体的通用动作层

提出通用动作层AnyAct,以渐进检索与测试时演化统一异构反馈,实现动态工具生态下的可靠高效编排。

04:00
arXiv cs.AI

面向医院患者流优化的物理信息多智能体协调

提出物理信息多智能体协调框架,将BCMP排队先验嵌入去中心化强化学习,协同优化患者流并降低系统延迟。

04:00
ArXiv AI

语言作为界面:基础模型对比学习连接转录组与电生理

LangPatch以语言为界面,用冻结文本编码器对齐基因与电生理表征,实现跨模态预测及脑区、物种迁移。

04:00
ArXiv AI

低秩参数化之外:通过梯度分解缩小LoRA与全量微调之间的差距

GDLoRA将权重梯度正交分解,提取LoRA切空间之外的“法向梯度”直接更新基权重,不增显存即缩小与全量微调的差距。

04:00
arXiv cs.CV

无模态误导的端到端自监督RGB-T跟踪

ESMTrack:端到端自监督RGB-T跟踪,免伪标签与密集标注,缓解模态主导,五基准领先且实时。

04:00
arXiv cs.AI

从可行失败前缀中学习:面向长时程LLM智能体的里程碑可行性潜力策略优化

提出MVPO,从可行失败前缀学习并修复零信用优势,显著提升长时程LLM智能体表现。

04:00
arXiv cs.CV

MSTypography:通过平衡词语可读性与物体可识别性实现多字符语义排版

提出全局到局部的多字符语义排版框架,兼顾字形可读性与物体可识别性,在五种语言上超越SOTA。

04:00
ArXiv AI

FedLAFP:联邦微调中低秩聚合与全秩个性化的融合

FedLAFP以共享LoRA低秩聚合、客户端私有RandLoRA全秩个性化,仅交换共享参数,四基准平均准确率86.93%,超最佳基线1.30个百分点。

04:00
ArXiv AI

MatToolBench:面向真实材料科学工作流的多模态智能体基准测试

首个真实材料科学软件多模态智能体基准,含204项任务,最佳仅GUI 25%、代码45%成功率。

04:00
arXiv cs.CV

面向设备-边缘多模态推理的基于残差向量量化的任务导向视觉特征压缩

提出Q-TOFC,用残差向量量化压缩视觉特征,融合查询相关聚合与量化误差补偿;负载较TOFC降53.6%,性能相当,时延更低。