62214 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.CV

PlenoCI:面向视角依赖感知变化分类的全光特征

从3DGS解析推导全光导数特征PlenoCI,忽略朗伯纹理、捕获视角依赖行为,用于变化分类,误报低两个数量级。

04:00
arXiv cs.CL

标签感知结构化文本翻译:迈向系统性理解

从数据合成、能力构建、多目标对齐三层面解决标签文本翻译的流畅性与标签保真度矛盾,六语向实验显著提升。

04:00
ArXiv AI

多任务模型中学习到的跨任务关系

提出通过成对任务关系近似联合分布来学习跨任务关系的框架,提升迁移学习与信息抽取,并在YouTube推荐系统验证。

04:00
arXiv cs.AI

RECLAIM:智能体能否复现机器学习论文的结论?

RECLAIM以百篇NeurIPS论文分三档评测智能体复现,最佳成功率仅41%、27%、15%。

04:00
arXiv cs.CV

HelloWorld:迈向生成式驾驶世界模型的实际应用

提出2B驾驶世界模型HelloWorld,实现多传感器可控生成与高效交互式仿真。

04:00
arXiv cs.LG

面向多丝平行板雪崩计数器的物理信息自监督学习:联合丝校准与相互作用位置重建

提出物理信息自监督框架,无需标注或专用校准,联合实现丝校准与相互作用位置重建,提升均匀性和分辨率。

04:00
arXiv cs.CL

从离群点预测新兴主题:嵌入空间中弱信号的前瞻性研究

研究被主题模型判为噪声的嵌入离群点能否前瞻预测新兴主题,法语新闻语料上高共识子集F1超0.90。

04:00
arXiv cs.CV

利用多模态大语言模型中的目标知识实现鲁棒的少样本分割

提出MK-FSS,用MLLM挖掘查询图像的空间与语义知识,经双记忆融合与跨模态提示增强少样本分割鲁棒性。

04:00
ArXiv AI

人机协同驱动的假设检验:成本感知的选择性AI评分与序贯人工升级

提出SCALE策略,融合选择性AI评分与自适应人工升级,以最低成本实现有效假设检验,逼近信息论下界。

04:00
arXiv cs.CL

EAGER:通过可验证奖励的强化学习增强生成式事件抽取

提出EAGER框架,以可验证奖励和模式对比优势估计缓解稀疏奖励坍塌,在七个基准上超越现有方法。

04:00
ArXiv AI

掌控运行框架,即掌控成本:企业级 AI 编程智能体的路由与治理

企业用自建路由器按请求分类调度模型,仅在缓存安全点切换,可削减 14%—21% 的模型开支。

04:00
arXiv cs.LG

OPDiv:Top-K高评分且多样化化合物的最优选择

OPDiv用整数优化平衡评分与多样性,选出高分且多样的Top-K最优子集,为虚拟筛选提供公平基准。

04:00
arXiv cs.LG

UO-FIE:结合精确标签监督与分级效用进行叙实性推断

UO-FIE结合精确标签监督与分级效用,缓解九类叙实性推断不平衡,微调赛道以0.8316效用居首。

04:00
arXiv cs.CL

后训练在无关决策上留下行为阴影

后训练在无关决策上留下行为阴影;ATD仅用教师单词即可跨任务迁移能力。

04:00
arXiv cs.CV

ViRDM:驾驭表征分布匹配,实现少步因果视频生成

ViRDM免教师与评论器,仅后训练生成器,20次更新使少步因果视频生成VBench达84.87,省显存耗时。

04:00
arXiv cs.LG

思维泄漏:混合推理模型中NoThink后训练的因果审计

因果审计显示,NoThink后训练收益中42%–79%来自向Think的思维泄漏,而非能力真正提升。

04:00
ArXiv AI

Forecast-Dojo:用于评测与训练 LLM 预测智能体的可回放环境

可回放预测基准,含千余事件与千万新闻,支持LLM预测智能体评测训练;工具提升预测,模型仍逊于市场。

04:00
arXiv cs.LG

超越静态图世界模型:在演化拓扑上学习随机潜动力学

提出GDM图世界模型,用稀疏循环邻接矩阵建模演化拓扑与随机潜动力学,并以GDD度量比较联合状态分布。

04:00
arXiv cs.CL

BanglaKontho:填补孟加拉语文本转语音的长文本空白

发布20小时孟加拉语TTS语料含7050条24kHz语音及文本规范化;WER9.5%、MOS4.46

04:00
arXiv cs.LG

迭代乘法的 RLVR 景观可以是良性的:来自自旋玻璃理论的启示

RLVR映射自旋玻璃,迭代乘法景观良性无局部极小;障碍是扩散势垒与梯度误差,调熵缓解,学会非阿贝尔群乘法推理。

04:00
arXiv cs.CV

RGBD20K:面向RGB-D语义分割的大规模基准

提出RGBD20K数据集,覆盖160类、2万对RGB-D图像,并提出SPF融合方法,刷新各基准最优性能。

04:00
arXiv cs.CL

思维链指令会破坏视觉语言模型的答案解码

思维链前缀评分会使视觉语言模型多选题评估严重失真,应避免使用。

04:00
arXiv cs.CL

pylazaro:用于西班牙语英语外来词(anglicism)提取的 Python 工具包

开源Python包pylazaro可自动提取西班牙语文本中的英语外来词,集成五种序列标注模型,效果优于通用大模型,下载超5.8万次。

04:00
arXiv cs.CL

基线形状决定结论:对 60K 参数三值语言模型的受控再检验

60K 参数三值模型复现:基线形状影响大于架构效应,路由优势不敌门控 SSM,量化惩罚与学习率设置左右结论。

04:00
arXiv cs.LG

LabFactory:构建与评估可执行的 AI 实验室

LabFactory 让 AI 构建者把科学需求变成可执行 AI 实验室,28 项交付系统经宿主端评测均超额。

04:00
arXiv cs.CV

基于透过率提取与距离对齐的无源长波红外高光谱测距

提出TEDA法:解耦测距与温度-发射率反演,先提取大气透过率再按距离对齐,降低偏差并提速约20倍。

04:00
ArXiv AI

从静态个人价值观到情境化个性化:面向大语言模型的贝叶斯个性化价值对齐

提出BaCVA,以静态价值观为先验,结合情境价值显著性推断后验偏好,实现情境化的个性化价值对齐。

04:00
arXiv cs.AI

回归定义:基于轨迹图估计智能体强化学习中的步级优势

提出GRAFT:将轨迹拼接为图,经贝尔曼迭代估计节点值以分配步级优势,多轮智能体任务超越GRPO。

04:00
arXiv cs.CV

分数之下:重新思考视频理解模型的幻觉评估

提出因果阶段干预法,发现定位是视频理解幻觉主因,其影响约为视觉观察的四倍,现有基准难以预测可靠性。

04:00
arXiv cs.LG

Delta 学习的机制:面向可泛化科学机器学习的目标设计

证明残差尺度不足以判断可学习性,提出尺度归一化图 Dirichlet 粗糙度诊断指标与基线互补原则。

04:00
arXiv cs.LG

AnDE分类器的联邦学习

提出支持任意阶的AnDE联邦学习框架,本地判别式训练、聚合保护隐私;优于联邦朴素贝叶斯,隐私损失小。

04:00
arXiv cs.CV

仅所见之物:3D高斯泼溅中视角相关外观的观测格拉姆压缩

以每高斯观测格拉姆矩阵为失真度量压缩球谐颜色,免训练下提升PSNR并缩减体积。

04:00
arXiv cs.CL

语法“祖母神经元”在大语言模型中很罕见

无探针NSI揭示LLM单神经元语法选择性稀疏弱窄,强“祖母神经元”罕见。

04:00
arXiv cs.AI

欧洲电力交易市场的功能架构:监管约束下对AI支持交易系统的要求

提出监管约束下欧洲电力交易AI功能架构,含决策状态、敞口核算、权限门控与故障闭锁,识别跨境协调瓶颈。

04:00
arXiv cs.LG

维护联邦学习中的鲁棒性:趋势、新兴策略与研究机遇

从威胁、聚合策略与防御三重视角综述联邦学习鲁棒性,梳理评估实践、应用与开放挑战。

04:00
arXiv cs.LG

无监督学习何时成功,何时失败?基于子空间追踪视角的重构式异常检测

基于子空间追踪视角,揭示重构式异常检测成败几何,提出动态推拉与嵌套流形雕刻,无标签提升检测与表示。

04:00
ArXiv AI

SLCA-GRPO:解决工具调用强化学习中的跨段信用误归因

SLCA-GRPO提出分段锁定信用分配,隔离工具与摘要token优势,消除跨段信用污染,提升准确率。

04:00
arXiv cs.CL

大语言模型评分器在何处成功、何处失效:来自两门计算机科学考试的证据

大模型评分可优于人工,但严格提示致开源模型崩溃或拒评;第二场考试复现且方向依考试,LoRA微调可修复。

04:00
arXiv cs.AI

MeshHeal:去中心化LLM智能体网络中灰度故障的双时间尺度自愈

MeshHeal以快慢双时间尺度同伴评审自愈,隔离退化智能体并支持恢复重入,效率与准确率双优。

04:00
arXiv cs.CV

幻觉栖身何处:VQ 分词视觉语言模型中的跨架构回路

定位VQ分词视觉语言模型共有的早期层注意力路由回路,仅消融L0可使开放生成物体幻觉相对降31%。

04:00
arXiv cs.LG

评估小波扩散降水降尺度模型的跨区域泛化能力

评估小波扩散降水降尺度模型的跨区域泛化:单区域训练仍具竞争力,性能与降水空间自相关高度相关。

04:00
arXiv cs.CV

WildHSR:基于3D基础模型的度量前馈式4D人物-场景重建

3D基础模型前馈重建带度量尺度与人物身份的4D人物-场景,EMDB-2/RICH领先,10.1 fps。

04:00
ArXiv AI

动作信用何时需要更新?

动作价值变化未必改变决策:提出成对分支敏感度与DSC-Gate,择机复用或迁移历史信用,使新增工具调用减少39.4%。

04:00
arXiv cs.LG

使用分布式声学传感与深度学习以精细时空分辨率监测城市交通动态

利用分布式声学传感与深度学习,将地下光纤振动转化为车辆轨迹与交通状态,实现米级秒级城市交通监测。

04:00
arXiv cs.CL

词性作为SAE潜空间中的涌现类别

SAE激活可高度还原词性,但不与单个潜变量一一对应,而由稀疏潜变量的分布式组合支撑,开放与封闭类差异显著。

04:00
arXiv cs.LG

强化学习中的策略复杂度、反应时间与有限理性

提出 MI-SARSA,以互信息正则权衡收益与策略复杂度,预测反应时间,体现有限理性下的序列学习。

04:00
arXiv cs.CL

ArGuard 共享任务:阿拉伯语模因与大语言模型提示中的有害内容检测

ArGuard共享任务评测阿拉伯语模因与LLM提示的有害内容,含两赛道;35队参赛,A2细粒度模因分类最难,最佳宏F1为0.823、0.419、0.984、0.790。

04:00
arXiv cs.CV

利用卫星影像中的答案不变冗余实现边缘端高效VLM推理

Rift利用答案不变冗余剪枝与弹性预填充,边缘端能耗降78%、延迟降69%,准确率升至73%。

04:00
arXiv cs.CL

从政策文件到结构化调查响应:评估大语言模型在政策监测中的应用

用大语言模型从政策文本生成结构化调查响应,结构化指标与人工一致率达84%–95%,显示人机协同潜力。

04:00
arXiv cs.CL

BanglaTurn:面向孟加拉语语音的话轮结束检测基准与基于Whisper的模型

发布孟加拉语话轮结束检测语料BanglaTurn(3.5万样本),基于Whisper的模型准确率达84.33%,远超基线69.28%,CPU端到端延迟165–191毫秒。