60940 条条目 · 106 个活跃源
2026年10月1日
04:00
ArXiv AI

ChronoGraph:面向交互理解与具身规划的视觉语言模型功能化4D场景图

提出功能化4D场景图ChronoGraph,统一表示观察与预期状态变化,训练视觉语言模型实现交互理解与可落地规划。

04:00
arXiv cs.CL

罗生门式维基百科:分歧历史叙事的数据视角主义分析

分析五语维基中罗马尼亚争议事件叙事分歧,发现引用隔离与地缘政治波动,提出Peace-Maker和解流程。

04:00
ArXiv AI

OverForge:通过策略与战术推理助力协作式终身适应

免训练分层架构OverForge分离持久策略与战术执行,提升协作智能体的长期适应与配合。

04:00
arXiv cs.AI

A 帮助 B,而 B 损害 A:指令微调混合中的有向迁移

任务迁移非对称:A助B而B损A。迁移图预测未见混合,跨规模选任务,推理准确率最高提升14个百分点。

04:00
arXiv cs.CV

PCB-MC:印刷电路板缺失元件分析

发布PCB-MC数据集,用于PCB缺失元件检测,含197种板型;基准显示现有方法在新板型上仍难奏效。

04:00
arXiv cs.CV

DensePed-Lite:面向遮挡下密集行人的质量感知自适应检测

提出DensePed-Lite,以质量感知自适应为原则,通过三项协同机制,在低复杂度下实现遮挡密集行人检测的精度效率更优平衡。

04:00
arXiv cs.LG

用于铁路车门异常检测的跨信号一致性周期感知自编码器

TCAA-CS以开停关周期无监督检测车门异常,融合重构、潜空间与跨信号一致性,召回93.8%、精确97.3%、误报0.5%。

04:00
arXiv cs.LG

稀疏优先推理引擎SparseEngine支持15种稀疏方法,吞吐超10倍,解码快2.5倍。

SparseEngine:稀疏优先推理引擎

04:00
arXiv cs.AI

信任不是分数:面向高风险 AI 智能体的运行时保障契约

提出运行时保障契约RAC,以强制门禁和证据状态动态约束高风险AI智能体权限,禁止仅凭总体评分授权行动。

04:00
arXiv cs.CV

InfoAgent:基于证据的信息图可追溯生成与修复

InfoAgent免训练,以类型化依赖图绑定证据,分层生成并依赖感知局部修复信息图,提升准确率、缩小修复范围。

04:00
arXiv cs.LG

Argus:真实 EKS 下预测 Spot 中断何时优于简单检查点

Argus在真实EKS验证:SIGTERM检查点可扛Spot回收;预测可零浪费,但提前量过大导致过迁移,周期性检查点仍是强基线。

04:00
arXiv cs.LG

面向蛋白质定向进化的结构感知强化学习

提出结构感知强化学习框架StructEvo,融合突变结构特征并分解突变空间,性能提升最高16.3%,发现GFP上位效应。

04:00
arXiv cs.CL

从失调到编排:同策略蒸馏中的教师干预

提出MAESTRO,用局部策略分歧自适应教师接管与生成时长,在八个数学推理基准领先,训练长度降67.3%。

04:00
arXiv cs.CL

E-MoE:面向非因子化扩散语言模型的增强型混合专家

基于MoE路由的离散共享隐变量,将反向过程建模为因子化分布混合,提升少步生成且不增参。

04:00
arXiv cs.CL

评估受监管智能体AI中的有限自主性:一个带有宪法奖励、升级标签与运行时治理的诊断测试装置

提出诊断框架,用六类信号与运行时治理评估受监管智能体有限自主性;小规模试验显示配置方差可压倒调参效果。

04:00
arXiv cs.LG

参数对称性决定过参数化非线性网络中的表征几何

参数对称性经加法、复制、缩放三种特征变换重塑表征,使表征几何分为本质与辅助成分,简并性随过参数化增长。

04:00
arXiv cs.CV

ResARC:面向超低码率图像压缩的残差感知自回归编码

提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。

04:00
arXiv cs.LG

泛化信号未必是模型选择信号

几何代理虽与泛化差距相关,却无法可靠选出部署最优模型:泛化信号未必是模型选择信号。

04:00
arXiv cs.CV

从残骸到智慧:从真实世界多视角照片中恢复碰撞力学

利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。

04:00
arXiv cs.LG

通过状态增广学习无限时域平均奖励CMDP

提出首个计算高效的无限时域平均奖励CMDP算法,达到最优√T遗憾与约束违反。

04:00
arXiv cs.LG

QuanVI:基于量子最大混合态的分数变分推断

QuanVI结合混合态密度算符与量子张量网络,压缩参数、规避简并本征向量不唯一,高维分数变分推断有效。

04:00
ArXiv AI

OSWorld-Science:面向学习与使用科学软件的计算机使用智能体基准

OSWorld-Science基准含146项科学软件任务,以执行评估检验智能体能力,顶尖视觉语言模型仍面临挑战。

04:00
arXiv cs.CV

从给定证据到收集证据:面向纵向医学推理的智能体学习

提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。

04:00
arXiv cs.AI

学习隐写术容易,学习隐写推理难

隐写推理远比隐写通信和编码推理难学,多数任务仅靠有监督微调习得;但掩护任务便利时三种方法皆可学会。

04:00
ArXiv AI

FIGS:在不惩罚共情的前提下评估多轮谄媚行为

提出双轴框架FIGS,用10轮自适应对话区分谄媚与共情,发现模型或滑向谄媚、或过度冷漠。

04:00
arXiv cs.CL

共语言学:AI增强的语言学理论构建

AI作为共同科学家参与语言学理论构建与评估,加速理论显式化、比较与提出,但人类仍居核心。

04:00
arXiv cs.CV

OmniReasoning:突破音视频联合推理极限

提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。

04:00
arXiv cs.AI

组件替换证据能确立什么?对LLM智能体中局部决策的批判性范围综述

综述348项研究,区分组件替换的任务收益与局部决策质量贡献,指出局部与任务指标同升不足以证明归因。

04:00
arXiv cs.AI

面向多线路公交驻站控制的完成感知跨保真度离线到在线强化学习

研究多线路公交驻站控制的跨保真度离线-在线强化学习,解决低乘客时间与行程未完成并存的失效模式。

04:00
arXiv cs.CL

哪种莎草纸文献HTR才够好?希腊语文本四项纸草学任务的字符错误率容忍度

以1–50%字符错误率测试希腊纸草文献四项任务:分类容忍20%,定年仅3%,含错重训可缓解性能下降。

04:00
ArXiv AI

ConflictGuide:让竞争性行为可见,自动研究性能得以提升

ConflictGuide 让竞争性行为可见,以探针反馈引导自动研究,任务与冲突错误最多降低 28% 和 14%。

04:00
arXiv cs.LG

T-Router:学习丘脑路由以实现参数高效强化学习推理

T-Router仅以0.466%参数实现丘脑式路由,复用计算块,推理超越LoRA与全参数GRPO。

04:00
arXiv cs.CL

正交却耦合:面向模型合并的几何分量解耦

DiGA以预训练权重为参考,将任务向量正交分解并分组件聚合重组,缓解跨组件耦合,提升模型合并性能。

04:00
ArXiv AI

覆盖优先于控制:面向可控逆合成的路线指令锚定与引导

提出RIGS两阶段框架:先训练投影器学习指令偏好,再引导冻结生成模型,兼顾备选覆盖与指令控制。

04:00
arXiv cs.CV

面向驾驶行为视频描述的预训练模型适配比较研究

比较自动驾驶中LLM微调与提示方法;在BDD-X上,全量微调SpaceTimeGPT部分指标超基线,并分析LoRA与VideoLLaVA提示工程的局限。

04:00
arXiv cs.CV

PartiCam:基于奖励引导的相机控制视频生成

提出免训练粒子滤波的奖励引导框架,以全局-局部精炼实现精准稳定的相机控制视频生成。

04:00
arXiv cs.LG

面向选定高斯过程近最优性证书的预序e值

以预序e值审计GP包络选择,剔除矛盾候选,用存活者最大上界作任意时间有效认证,降低误认证风险。

04:00
arXiv cs.CL

语料库引导的双路径传播用于图检索增强生成

提出NexusRAG,用语料级实体邻域结构引导语义与结构双路径传播,提升多跳检索证据召回率。

04:00
arXiv cs.LG

Muon 中的行归一化之谜

研究Muon行归一化:引入维度相关复杂度因子,合成任务更慢,大模型预训练却更优,理论实践仍成谜。

04:00
arXiv cs.CL

System One 模型 Jev 的评估与基准测试

零样本评测 Jev:37 个数据集多数优于 Qwen/Gemma,概率校准良好,支持选择性预测。

04:00
arXiv cs.AI

GrammarRL:通过强化学习实现有效的语法约束解码

GrammarRL用正反向自监督奖励的强化学习适配语法约束,无需标注,成本同贪心解码,提升达9.8分。

04:00
arXiv cs.CL

读者熟练度塑造逐层惊奇度特征

词汇熟练度影响LLM惊奇度的分层预测深度:低熟练读者首遍注视的预测深度更深,总注视时长亦然。

04:00
arXiv cs.CV

从前到后:面向非对称跨视角车辆重识别的视觉语言模型基准测试

提出前到后车辆重识别基准,评测视觉语言模型;其未稳定超越检索基线,推理可提升,人类更可靠。

04:00
arXiv cs.LG

CDMD:面向表格数据的跨数据集混合类型扩散模型

提出CDMD,直接在混合类型特征空间上跨数据集联合训练扩散模型,单模型生成质量优于各专用模型。

04:00
arXiv cs.LG

ID 平衡:基于 PID 负载控制的极稀疏 MoE 稳定训练

将无辅助损失方法视为不完整PID控制器,提出ID平衡,随误差增大加强校正,降低负载不均衡并稳定训练。

04:00
arXiv cs.CL

配对难度至关重要:重新审视成对式LLM评判评估与一致性

现有评判指标多受近秩差配对主导,不一致实属必然;排序信号来自大秩差配对,故应按秩差条件化评估。

04:00
arXiv cs.CV

面向文本到图像模型后门防御的正常扩散动力学学习

提出NDDL,仅用良性样本学习扩散轨迹正常转移动力学,以预测偏差检测并定位后门,泛化性强。

04:00
arXiv cs.LG

面向大语言模型服务的高带宽闪存特性研究

HBF扩展LLM服务内存,分层存储与缓存感知调度使完成时间降36.1–87.0%、能耗降55.8%,写入寿命延至14.82年。

04:00
arXiv cs.AI

更好的演示文稿,还是不同的评审?评估企业和投资银行中智能体框架的增益

投行演示稿智能体框架得分高于直接生成,但评审差异与重复评分波动削弱改进结论。

04:00
arXiv cs.CV

镜头光晕去除与重建

提出光晕去除与重建:建大型数据集,微调扩散模型去大光晕;建模光晕并与3DGS联合分解,可编辑迁移。