61986 条条目 · 106 个活跃源
2026年9月28日
04:00
arXiv cs.CL

基于攻击链建模的邮件智能体提示注入检测

攻击链建模检测邮件智能体提示注入:融合文本检测、阶段验证与意图一致性;无害仿攻击邮件降误报,性能优于强基线。

04:00
arXiv cs.AI

DIAL:位置去偏且具备自适应人类偏好校准的LLM评审器

DIAL融合大量LLM比较与有限人类比较,分离位置效应、去偏并自适应校准至人类偏好,实现稳健对齐。

04:00
arXiv cs.LG

面向多缺失数据的鲁棒图聚类网络

提出RGCN,应对属性与结构同时缺失,借双分支插补、多超球混合先验与边界感知对比学习提升聚类。

04:00
arXiv cs.CV

ClearGS:面向手持视频的可靠性感知高斯泼溅

提出ClearGS,用可靠性感知视图分配与渲染引导视频内修复,无需清晰参考即从手持视频重建高质量3D高斯泼溅。

04:00
ArXiv AI

G2MAF:面向多智能体流策略的测试时梯度引导

G2MAF以全局归一化投影评论家梯度在测试时协调修正多智能体联合动作,保持可行且贴近冻结策略,多数任务提升。

04:00
ArXiv AI

分段级智能体主题建模:提升数据探索与资源效率

提出SeLATM,用分段级主题生成与智能体反馈精炼主题,在多数据集上性能更优且显著降低LLM资源消耗。

04:00
arXiv cs.AI

MA-WAM:面向测试时规划的多智能体世界-动作模型

首个多智能体流策略的测试时世界模型规划器,建模动作依赖并高效评估联合动作,离线MARL平均提升22%,仅增12.1毫秒。

04:00
arXiv cs.LG

PORL:面向作业车间调度问题的预训练离线强化学习

PORL先在线预训练,再以KL约束离线微调,用于作业车间调度,优于离线RL且更抗数据质量下降。

04:00
arXiv cs.CL

JevAdvBench:面向校准决策强化学习模型的基准与黑盒攻击

首个RLCD对抗基准,以自身干净决策为参照;未验证观点可翻转12.1%决策,使38%高置信答案跌破审查阈值。

04:00
arXiv cs.CL

面向编程智能体的紧凑文档:基准、优化器及其为何无法迁移

提出往返基准与优化器:保真度靠完整性而非长度;但跨模型十仓库显示,更好文档无法提升智能体解决真实问题的效果。

04:00
arXiv cs.CV

开放词汇域遗忘

提出开放词汇域遗忘(OVDU),用Fisher掩码与目标流形散射实现类无关遗忘,4样本超8样本基线。

04:00
arXiv cs.LG

迈向理解河谷型损失景观中的动量加速

河谷景观中,动量靠稳定大学习率、防偏离河道加速;极平坦慢旋河谷下,加速主要源于更大可允许学习率,而非动量本身。

04:00
ArXiv AI

可变对话记录:通过可编辑的会话状态缓解上下文污染

可变对话记录让用户用自然语言修订先前轮次,缓解上下文污染;用户研究显示其更清晰、更易用,减少重启对话。

04:00
arXiv cs.CL

Intent2Tc:基于语言模型的意图到流量控制自动转换

提出 Intent2Tc,用语言模型将业务意图转为可执行 Linux tc 配置,语义与配置精度高,RAG 降本提速。

04:00
ArXiv AI

正确的信息抽取流水线取决于文档类型:小型本地模型的精度—能耗权衡

批处理可降能耗38%—85%且不损精度;版式丰富文档宜用视觉语言模型,近纯文本宜用小型文本模型加廉价解析器。

04:00
arXiv cs.LG

学习气候模型中强迫对温度影响的分层因果表征

提出分层因果表征学习框架,分离内部变率与温室气体、气溶胶强迫响应,准确预测全球及区域温度演变。

04:00
arXiv cs.CV

高光谱视频压缩的隐式神经表示

隐式神经表示用于高光谱视频压缩,逐帧传统法PSNR增4.99dB、码率降88.88%,提升目标跟踪。

04:00
arXiv cs.CL

为何阿尔茨海默病语音筛查难以泛化:通过跨语料库证据锚定弥合部署鸿沟

四语料留一评估显示语音特征跨语料方向冲突,提出证据锚定融合,最差域AUC由0.504升至0.615。

04:00
ArXiv AI

从皮层区域视角看大语言模型中的层程序

复现PoLar:层块跳过与重复提升性能,但学得路由器单次推理退化为标准前向,通用程序少而脆弱。

04:00
arXiv cs.LG

物理信息神经网络的梯度手术

提出物理感知梯度手术PAM-GS,按冲突类型自适应缓解PINN任务干扰,提升精度与平衡性。

04:00
ArXiv AI

完成配对掩盖了封顶失败:选择性上下文投影的 ReVerPi 案例研究

仅看完成配对会掩盖失败:上下文投影省 25% 逻辑 token,却增加请求与开销,须保留所有边界并独立执行两臂。

04:00
arXiv cs.AI

Purin:一种受生物学启发的人工神经网络机制

提出生物启发且兼容ANN的Purin,以时间间隔抽象实现突触效能调制,无需离散时间步,提升CNN分类精度。

04:00
ArXiv AI

压缩所见而非所言:面向潜在观测软件工程智能体的锚定上下文蒸馏

LOHA分离压缩历史与精确文本,ACD蒸馏潜在读取并约束行为漂移,降低上下文、提升软件工程智能体效率。

04:00
arXiv cs.CV

从奖励信号到视觉效用:医学视觉语言模型后训练的受控审计

审计医学VLM后训练:准确率提升有限,视觉获益和图像敏感性反降,优化目标与有用视觉行为存在差距。

04:00
arXiv cs.CL

面向缓解虚假共识:多智能体辩论综合的主动溯源门控

提出主动溯源门控,事后核验并阻断无据主张,困难场景溯源保真度提升逾一倍,超75%用户偏好明确失败报告。

04:00
arXiv cs.LG

鲁棒后继特征

提出鲁棒后继特征,统一奖励与转移核泛化,给出GPI性能界并在网格基准验证。

04:00
arXiv cs.CV

诊断视觉-语言模型组合性失败的来源:一项受控分析

COMPASS受控分析发现:VLM组合失败中整合成本仅部分,各技能受自身负载拖累,交叉负载多有益,属多因素。

04:00
arXiv cs.CL

夸父:在十亿规模下将长用户行为压缩为理解

夸父在十亿规模逐条压用户行为至2-4 token,提吞吐、省GPU,线上GMV增1.37%。

04:00
arXiv cs.CV

KneePreM:面向三维膝关节MRI基础模型的大规模无标注预训练与标签高效微调

KneePreM为膝MRI三维自监督模型,经1.9万例无标注预训练,分类与分割的迁移性能及标签效率显著提升。

04:00
arXiv cs.CV

SatNav:基于卫星影像的可扩展长时程无人机视觉语言导航基准

提出基于卫星影像的可扩展长时程无人机视觉语言导航基准,涵盖18城11.8万回合,验证卫星到无人机迁移可行。

04:00
arXiv cs.CL

Google Play 用户评论情感指数的统计基础:信号融合、收缩、分布验证与动态平滑

构建Google Play评论统计情感指数:融合星级与文本,结合收缩、分布检验与卡尔曼滤波去噪,并给出数学证明。

04:00
arXiv cs.CL

PriceBench:面向LLM预订代理中价格、质量与品牌偏好的诊断基准

PriceBench用酒店预订任务诊断大模型的价格、质量与品牌偏好:能力只决定偏好一致性,须逐模型测量。

04:00
arXiv cs.LG

混合语言模型中的低比特循环状态

无需校准,格拉姆矩阵加权混合精度量化;4比特混合语言模型循环状态降低负对数似然差距,6比特逼近浮点基线。

04:00
arXiv cs.CV

ContraFM-S2O:基于流匹配与对比学习的一步式SAR到光学图像翻译模型

提出ContraFM-S2O,以流匹配和对比学习实现一步SAR到光学图像翻译,细节更优、推理更快,达SOTA。

04:00
arXiv cs.LG

视觉-语言-动作模型的线性表示假设

VLA中QoI随动力学演化,提出签名式线性表示假设,统一表示与策略,实现线性探测与引导。

04:00
arXiv cs.CV

OpenVAM:基于视觉语言模型的开放世界视觉注意力建模

提出OpenVAM框架,解耦视觉定位与VLM语义解释,跨域预测显著图并生成what/why解释。

04:00
arXiv cs.CL

两种用于自适应文档内 AI 文本筛查的共形构造

提出两种共形构造,用于自适应文档内 AI 文本筛查,控制误报并支持提前停止,效能待实证。

04:00
arXiv cs.CV

AxonSynth:面向光片显微镜零样本三维轴突分割的域随机化合成数据

AxonSynth以域随机化合成数据实现光片显微镜轴突零样本3D分割,无需真实标注。

04:00
arXiv cs.LG

LipSSM:基于相邻SSM层间度量传递的结构化Lipschitz有界级联状态空间模型

提出LipSSM:在级联状态空间层间迁移度量,获更紧Lipschitz界并建模长程依赖,理论实验验证

04:00
arXiv cs.LG

面向移动系统的元认知选择性集成

MetaSE利用模型可靠性短期持续性维护小活跃集,按需路由,精度媲美全集,速度快2.7倍、省69%内存。

04:00
ArXiv AI

DeepEdu-v1:面向越南教育的高效可扩展智能体大语言模型

DeepEdu-v1面向越南教育,长上下文推理提速近2倍,智能体准确率由70.0%升至79.5%。

04:00
arXiv cs.CL

基于信念自蒸馏的用户模型提取

BSD框架通过自蒸馏学习可读写的用户信念表示,揭示拒绝取决于模型推断的用户意图,且跨模型几何一致。

04:00
ArXiv AI

不学停止而学会停止:自监督置信度训练提升推理效率

自监督置信度微调无需优化长度或早停,即可在保持精度下减少最多25%推理token。

04:00
arXiv cs.AI

游戏竞技场:竞争环境中的大语言模型战略评估

推出Kaggle游戏竞技场,以象棋、扑克、狼人杀等对抗游戏动态评估大模型的战略规划与不确定性适应能力。

04:00
arXiv cs.CV

针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御

CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。

04:00
ArXiv AI

软件架构中什么仍将属于人类?一项焦点小组报告

焦点小组探讨AI辅助软件架构,认为架构决策、问责与护栏制定仍属人类,提出治理工程与认知债务概念。

04:00
arXiv cs.LG

域偏移下以教师为锚的训练后量化模型选择

研究域偏移下标签缺失或稀少时的量化模型选择,教师锚定可降低小标签预算下的选择遗憾,标签增多后优势消失。

04:00
ArXiv AI

编码智能体还不够!面向智能体化云调查的企业安全大脑评估

Sola安全大脑在28项云安全调查任务中覆盖率达0.693,远超通用编码智能体的0.387,成本更低。

04:00
arXiv cs.AI

多智能体在析取型与补偿型任务上的规模化扩展

任务结构决定多智能体扩展:析取型任务中投票难兑现潜力,补偿型任务平均仅减误差6%。

04:00
ArXiv AI

"AI 是(不是)新的……":生成式 AI 文化影响的诊断性类比框架

提出诊断框架,从认知场域、治理逻辑、技术机制三坐标分析生成式AI文化影响,区分结构与偶然后果。