61198 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.AI

WEFT:面向通用智能体的工具使用后训练规模化

WEFT提出全系统演化框架,协同扩展交互系统、执行驱动自演化与稳定后训练,多基准超越同规模基线。

04:00
arXiv cs.CV

VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准

迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。

04:00
arXiv cs.CV

Back2Struct:让结构化图像重新可编辑

从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。

04:00
arXiv cs.CV

Salt++:面向少步流式多模态生成的上下文对齐后训练

Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。

04:00
arXiv cs.AI

当上游消息覆盖正确答案:多智能体LLM协作的受控研究

错误上游消息可使下游在32%情况下覆盖正确答案,94%为答案替换;通信应依据上游可靠性有选择地进行。

04:00
arXiv cs.CV

UltraMatch:面向超快与内存高效图像匹配的传输路径路由

UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。

04:00
arXiv cs.LG

大语言模型预训练的相对泛化不变性

提出相对泛化不变性(RGI):优化器与架构变化下近似成立,数据流变化则显著改变相对泛化。

04:00
arXiv cs.CL

多轮大模型污染中的认知策略分歧:一项协议梯度研究

多轮对话中虚假前提可被LLM当作事实采纳;五种污染协议沿权威梯度揭示模型采纳率与恢复能力的显著分化。

04:00
arXiv cs.CL

大语言模型能在多大程度上模拟真实学习者对教育反馈的评价?

LLM模拟真实学习者评价能力仍有限;提供画像与示例可改善分数校准和个体模拟,但难提升群体一致性。

04:00
arXiv cs.CL

从输入到输出:面向稀疏自编码器特征双端解读的灵活智能体

提出DAFI智能体,从输入端与输出端双向采集证据并迭代解读稀疏自编码器特征,兼顾准确率与效率。

04:00
arXiv cs.AI

超越次高斯检测器得分:面向人机文本分割的鲁棒加权轮廓损失变点检测

提出RWCP,以截断权重、Huber增益和可靠度坐标搜索稳健定位人机文本作者切换点,WindowDiff降17.6%。

04:00
ArXiv AI

HorizonFlow:面向离线目标条件强化学习的可变长度规划

HorizonFlow将规划长度作为生成输出,以插入式生成加流匹配联合生成内容与长度,无需价值模型,多基准平均性能最优。

04:00
arXiv cs.AI

驾驭框架演化即学习:自我改进型个人智能体的近似、泛化与优化极限

将驾驭框架演化视为学习问题,从近似、泛化与优化误差解释个人智能体自改进的局限。

04:00
arXiv cs.CV

面向星上数据缩减的嵌入式双时相建筑损毁评估

基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。

04:00
ArXiv AI

STAR-GRPO:面向表示依赖型奖励黑客的规范锚定与可靠性优先优势估计

提出STAR-GRPO,以可靠性优先优势估计分离质量与学习影响,锚定规范信号,有效抑制奖励黑客并提升真实质量。

04:00
arXiv cs.LG

基于采样内原始-对偶引导的可行流匹配图重建

提出约束原始-对偶PIFM,以采样中演化的拉格朗日乘子引导图重建,可行性提升11–26个百分点且无需重训。

04:00
arXiv cs.CL

神经科学中的深度学习方法:从分子机制建模到意识状态分类

综述深度学习在意识状态分类、麻醉脑建模与意识标志物识别中的应用,指出现有模型可解释性与标准化不足。

04:00
arXiv cs.LG

强化学习中的自确认叠加陷阱

RL训练可陷入自确认叠加陷阱,拟合全局最优仍维持低回报;保留被忽视状态可减少干扰并提升控制。

04:00
arXiv cs.CL

决策而非生成:基于Jev类型化决策的竞争性维度ABSA

冻结Jev以类型化决策完成维度ABSA三任务,无需生成微调;回归RMSE最低,抽取F1超微调大模型。

04:00
arXiv cs.LG

表格数据噪声标签的自适应集成选择

集成模块依数据属性为多类检测器赋权,诊断并清洗噪声标签;受控噪声下媲美置信学习,效果随数据属性变化。

04:00
arXiv cs.CV

面向高效视频生成的参数化条纹注意力

提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。

04:00
arXiv cs.CL

MemoReason:评估参数记忆对大语言模型上下文推理的影响。

提出配对真实与虚构推理的基准,发现大模型存在记忆偏差,性能降达15.7%,但非直接参数捷径。

04:00
arXiv cs.CV

面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架

用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。

04:00
arXiv cs.CL

衡量同质面板LLM辩论中的崩溃与纠正

提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。

04:00
arXiv cs.LG

超越令牌节省:LLM智能体上下文压缩的系统性研究

系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。

04:00
arXiv cs.CL

SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序

SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。

04:00
arXiv cs.LG

数据应当教会什么?在电路、存储与使用间迁移瓶颈

电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。

04:00
arXiv cs.CV

RBF-GNN:面向伪坐标图卷积的有理基函数

提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。

04:00
arXiv cs.CL

评分标准感知的同策略自蒸馏:面向大语言模型个性化

提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。

04:00
arXiv cs.LG

基于通用函数逼近的抗饱和对决老虎机

研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。

04:00
arXiv cs.CL

当文字比图像更响亮:理解视觉语言模型中的语言偏见

VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。

04:00
arXiv cs.LG

约束流策略更新:广义薛定谔桥视角

提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。

04:00
arXiv cs.LG

裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡

重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。

04:00
arXiv cs.LG

偏微分方程先验的高效消息传递

基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。

04:00
arXiv cs.AI

从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样

提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。

04:00
arXiv cs.AI

CADOC:面向长时程智能体的缓存感知动态对象上下文

CADOC批量替换上下文对象为卡片,保留按需检索,输入成本降约40%,性能接近全上下文。

04:00
ArXiv AI

神经符号计算机使用:学习可复用策略以实现可靠高效的执行

提出神经符号计算机使用,将重复工作流固化为可复用策略,神经模型处理依赖观测的决策,大幅降本增效。

04:00
arXiv cs.CV

MotionInsight:诊断生成视频中的物体运动缺陷

提出VidMotion数据集与MotionInsight评估器,实现物体运动缺陷的三维诊断。

04:00
arXiv cs.AI

首个面向交通信号控制的视觉-语言-动作模型

首个基于视觉-语言-动作模型的端到端交通信号控制方法,直接从多视角路侧视频映射为协调信号动作。

04:00
arXiv cs.CV

NHO:一种用于基于锚点的区域定位与稠密对应的神经哈密顿算子

NHO用稀疏锚点和内蕴几何学习神经哈密顿算子,以局域特征空间互惠细化,实现区域定位与稠密对应,抗缩放旋转。

04:00
ArXiv AI

双通道鲁棒群相对策略优化:基于优势与序列权重估计

提出双通道鲁棒优化器RoVR-GSPO,以有界残差信用与SoftRoVR聚合稳健估计优势和序列权重,抗奖励污染与比率异常,优于GSPO。

04:00
arXiv cs.AI

CoEM:以证据确认记忆赋能长上下文推理

CoEM暂存原文证据,随新上下文决定提升、保留或丢弃,经验证器校验,强化学习训练,提升长上下文推理。

04:00
arXiv cs.CV

OmniRoute:将时序语义证据映射至音视频令牌预算,实现高效全模态大语言模型

提出免训练两阶段压缩框架OmniRoute,按时序语义证据分配音视频令牌预算,兼顾效率与性能。

04:00
arXiv cs.AI

SCA:面向GUI智能体强化学习的空间信用分配

提出SCA,用点击坐标细化组相对信用,提升GUI智能体定位与动作预测,部署策略不变。

04:00
arXiv cs.CV

Real2Gym:从视频构建仿真训练场,让机器人获得技能

提出Real2Gym,将视频演示转为交互仿真训练场,习得技能迁移至真机,真机成功率超GPT-6 Astra 33.3%。

04:00
arXiv cs.CV

无承诺的上下文:非刚性变形下的鲁棒稠密对应

CoCo-Reg以区域块丰富稠密点特征却不限制最终点级搜索,非刚性配准对应误差降低72.6%。

04:00
arXiv cs.CV

Spatial-OPSD:通过无标签自蒸馏实现自我改进的空间推理

无标签自蒸馏,用深度与三维先验由教师对学生轨迹做词元级监督,逐轮递归训练实现多轮自提升并达开源前沿。

04:00
ArXiv AI

CF-LoRA:解耦因子聚合与适应感知客户端聚类用于联邦LoRA微调

CF-LoRA通过解耦因子聚合与适应感知聚类,解决联邦LoRA微调的聚合与协作不匹配,提升异构数据下的精度。

04:00
arXiv cs.AI

REALHOP:以行为审计重新审视多跳推理评估

提出行为必要性率(BNR):答案正确≠多跳推理;REALHOP将BNR从27.4%升至94.4%。

04:00
arXiv cs.CV

GleanVID:面向高效视频大语言模型的互补Token选择

GleanVID是免训练的视频大模型推理加速框架,按时间新颖度分配预算并联合代表性与互补性选Token,25%Token保留98.6%性能。