61263 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.LG

场景理论:打破多智能体大语言模型协同中的对称性陷阱

同质LLM智能体无通信并发易陷对称陷阱;提出免训练ToS,靠公共角色与场景分工,在多个基准超越基线。

04:00
arXiv cs.CL

语言模型内省的机制研究

固定输入下注入概念向量,发现中层门控头决定是否报告,后层路由头定位扰动,准确率依赖概念向量对齐。

04:00
arXiv cs.CL

从规范框架到对齐数据:构建与评估SFT与偏好数据

七位专家依伊斯兰伦理构建2.8K SFT与5.4K偏好数据;SFT显著提升对齐,偏好数据增益不显著。

04:00
arXiv cs.LG

逻辑的几何:分层诱导语义结构与稳健推理

STRAT将残差流分为数据/类型子空间,提升逻辑推理泛化;算术OOD误差降35倍,分布偏移下更稳健。

04:00
arXiv cs.CL

理解同策略蒸馏:基于稀疏交叉编码器的机制可解释性视角

借助稀疏交叉编码器与交换读出法发现:同策略蒸馏不创造新特征,只是重新加权学生已有的共享特征。

04:00
arXiv cs.AI

陈旧度在哪里累积?面向大语言模型后训练中异步RL的池感知有效陈旧度控制

将轨迹陈旧度分为生成与等待陈旧,提出池感知PACE控制,提升异步RL精度并省47% GPU时间。

04:00
arXiv cs.LG

TwinS-GCN:用于谱图卷积网络的谱共轭

提出谱共轭分解移位算子,构建TwinS-GCN双滤波器,实现长程无衰减传播,节点分类具竞争力。

04:00
arXiv cs.LG

面向PDE贝叶斯反演的自然语言条件生成先验

自然语言条件生成先验,融合文本、数据与少量噪声传感,用于PDE贝叶斯反演与不确定性量化。

04:00
arXiv cs.CL

当置信度过早上升:通过过早答案承诺检测捷径推理

提出ConfLens追踪答案置信度演化,用DACS分布熵检测过早自信捷径,改善奖励模型偏好。

04:00
arXiv cs.AI

IronLLM:为实时具身智能锻造紧凑的端侧原生语言模型

IronLLM-0.6B为6.54亿参数端侧语言模型,融合混合注意力与X-MTP多token预测,解码提速1.48倍,性能媲美更大模型。

04:00
ArXiv AI

中文标题:PrecogUI:通过预认知模拟与经验检索实现的主动式GUI智能体

PrecogUI预认知架构融合经验池、模拟预测与闭环纠错实现主动决策,在强干扰长程任务上超越现有方法。

04:00
ArXiv AI

基于统计形状模型与深度学习的骨盆骨折复位螺钉自动规划

提出全自动骶髂螺钉术前规划流程,自动识别安全通道并生成个体化轨迹;200例验证:安全边界提升2%,规划时间减少逾90%,接受率达95%。

04:00
ArXiv AI

状态轨迹推理解释作为强化学习中的辅助任务

STRAT以预测自身状态文本轨迹为辅助任务,助RL攻克稀疏奖励难题,压缩状态表示并提供可读解释。

04:00
arXiv cs.CV

World2Motion:将视频世界模型转化为三维人体动作生成器

将视频世界模型改造为单阶段3D人体动作生成器,构建混合数据并提出偏移解耦噪声调度,推理提速约3.3倍。

04:00
arXiv cs.CV

视觉并行搜索:通过并行瓦片检查与自适应缩放学习搜索高分辨率图像

提出VPS视觉并行搜索框架,主智能体并行检查图像瓦片并自适应缩放,提升高分辨率视觉问答,且可训练。

04:00
arXiv cs.AI

WEFT:面向通用智能体的工具使用后训练规模化

WEFT提出全系统演化框架,协同扩展交互系统、执行驱动自演化与稳定后训练,多基准超越同规模基线。

04:00
arXiv cs.CV

VesselBench-800K:面向多模态船舶检测、计数与密度估计的大规模感知基准

迄今最大全球多模态船舶感知基准,含80万张512×512光学/SAR图像,支持检测、计数与密度估计。

04:00
arXiv cs.CV

Back2Struct:让结构化图像重新可编辑

从图像恢复可编辑 SVG/XML 代码,让图表等结构化图像可编辑并保持视觉保真。

04:00
arXiv cs.CV

Salt++:面向少步流式多模态生成的上下文对齐后训练

Salt++以因果自流与上下文对齐自回归DMD两阶段后训练,实现4步流式音视频生成,视觉与运动质量大幅领先。

04:00
arXiv cs.AI

当上游消息覆盖正确答案:多智能体LLM协作的受控研究

错误上游消息可使下游在32%情况下覆盖正确答案,94%为答案替换;通信应依据上游可靠性有选择地进行。

04:00
arXiv cs.CV

UltraMatch:面向超快与内存高效图像匹配的传输路径路由

UltraMatch以路由少量候选路径替代稠密token匹配,大幅提速省内存,单卡支持6K分辨率推理。

04:00
arXiv cs.LG

大语言模型预训练的相对泛化不变性

提出相对泛化不变性(RGI):优化器与架构变化下近似成立,数据流变化则显著改变相对泛化。

04:00
arXiv cs.CL

多轮大模型污染中的认知策略分歧:一项协议梯度研究

多轮对话中虚假前提可被LLM当作事实采纳;五种污染协议沿权威梯度揭示模型采纳率与恢复能力的显著分化。

04:00
arXiv cs.CL

大语言模型能在多大程度上模拟真实学习者对教育反馈的评价?

LLM模拟真实学习者评价能力仍有限;提供画像与示例可改善分数校准和个体模拟,但难提升群体一致性。

04:00
arXiv cs.CL

从输入到输出:面向稀疏自编码器特征双端解读的灵活智能体

提出DAFI智能体,从输入端与输出端双向采集证据并迭代解读稀疏自编码器特征,兼顾准确率与效率。

04:00
arXiv cs.AI

超越次高斯检测器得分:面向人机文本分割的鲁棒加权轮廓损失变点检测

提出RWCP,以截断权重、Huber增益和可靠度坐标搜索稳健定位人机文本作者切换点,WindowDiff降17.6%。

04:00
ArXiv AI

HorizonFlow:面向离线目标条件强化学习的可变长度规划

HorizonFlow将规划长度作为生成输出,以插入式生成加流匹配联合生成内容与长度,无需价值模型,多基准平均性能最优。

04:00
arXiv cs.AI

驾驭框架演化即学习:自我改进型个人智能体的近似、泛化与优化极限

将驾驭框架演化视为学习问题,从近似、泛化与优化误差解释个人智能体自改进的局限。

04:00
arXiv cs.CV

面向星上数据缩减的嵌入式双时相建筑损毁评估

基于YOLOX孪生检测器,压缩上行参考并在星上比对,仅下行目标级损毁结果,抗配准误差,嵌入平台验证。

04:00
ArXiv AI

STAR-GRPO:面向表示依赖型奖励黑客的规范锚定与可靠性优先优势估计

提出STAR-GRPO,以可靠性优先优势估计分离质量与学习影响,锚定规范信号,有效抑制奖励黑客并提升真实质量。

04:00
arXiv cs.LG

基于采样内原始-对偶引导的可行流匹配图重建

提出约束原始-对偶PIFM,以采样中演化的拉格朗日乘子引导图重建,可行性提升11–26个百分点且无需重训。

04:00
arXiv cs.CL

神经科学中的深度学习方法:从分子机制建模到意识状态分类

综述深度学习在意识状态分类、麻醉脑建模与意识标志物识别中的应用,指出现有模型可解释性与标准化不足。

04:00
arXiv cs.LG

强化学习中的自确认叠加陷阱

RL训练可陷入自确认叠加陷阱,拟合全局最优仍维持低回报;保留被忽视状态可减少干扰并提升控制。

04:00
arXiv cs.CL

决策而非生成:基于Jev类型化决策的竞争性维度ABSA

冻结Jev以类型化决策完成维度ABSA三任务,无需生成微调;回归RMSE最低,抽取F1超微调大模型。

04:00
arXiv cs.LG

表格数据噪声标签的自适应集成选择

集成模块依数据属性为多类检测器赋权,诊断并清洗噪声标签;受控噪声下媲美置信学习,效果随数据属性变化。

04:00
arXiv cs.CV

面向高效视频生成的参数化条纹注意力

提出参数化条纹注意力PSA,统一刻画视频DiT的周期对角条纹,单内核生成稀疏掩码,提速1.57倍。

04:00
arXiv cs.CL

MemoReason:评估参数记忆对大语言模型上下文推理的影响。

提出配对真实与虚构推理的基准,发现大模型存在记忆偏差,性能降达15.7%,但非直接参数捷径。

04:00
arXiv cs.CV

面向业务化哨兵-2小麦面积估算中地面真值标签噪声消解的双轨数据整理与分类框架

用13期哨兵-2 NDVI与849样本,XGBoost最优;预测面积较官方仅高2.99%,优于空间掩膜25.11%,提出双轨整理分类框架。

04:00
arXiv cs.CL

衡量同质面板LLM辩论中的崩溃与纠正

提出可审计协议,追踪同质辩论的崩溃与纠正,揭示防崩溃可能以损失纠正为代价。

04:00
arXiv cs.LG

超越令牌节省:LLM智能体上下文压缩的系统性研究

系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。

04:00
arXiv cs.CL

SCBO:面向基于大语言模型的社会调查的语义连贯批处理与排序

SCBO为免训练框架,用语义批处理、共享参考库与难易排序,降低token消耗与推理时间并提升准确率。

04:00
arXiv cs.LG

数据应当教会什么?在电路、存储与使用间迁移瓶颈

电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。

04:00
arXiv cs.CV

RBF-GNN:面向伪坐标图卷积的有理基函数

提出RBF-GNN,用有理Padé基函数替代随维度指数增长的B样条,提升关键点匹配等任务性能。

04:00
arXiv cs.CL

评分标准感知的同策略自蒸馏:面向大语言模型个性化

提出GRASP框架,用评分标准感知的同策略自蒸馏将用户偏好转为token级监督,并验证教师质量,在LaMP-QA上达最优。

04:00
arXiv cs.LG

基于通用函数逼近的抗饱和对决老虎机

研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。

04:00
arXiv cs.CL

当文字比图像更响亮:理解视觉语言模型中的语言偏见

VLM易受语言偏见,本文基于词补全分四阶段追踪传播,揭示语言先验与跨模态覆盖交互。

04:00
arXiv cs.LG

约束流策略更新:广义薛定谔桥视角

提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。

04:00
arXiv cs.LG

裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡

重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。

04:00
arXiv cs.LG

偏微分方程先验的高效消息传递

基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。

04:00
arXiv cs.AI

从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样

提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。