5884 条条目 · 106 个活跃源
2026年8月24日
04:00
ArXiv AI

CellPath-Bench:病理基础模型全切片细胞表征的多维基准

提出CellPath-Bench,评估30个病理基础模型的细胞类型解码与跨域迁移能力,揭示模型差异。

04:00
ArXiv AI

中文标题:法律AI能否自知犯错?学生又能否察觉?

中文摘要:研究发现AI模型存在“自信惯性”,对错误判决给出高置信度(HCER最高31.7%)。学生遇虚假引用时验证增加,但多数未受AI伦理训练。建议强化对抗式教学与溯源验证。

04:00
ArXiv AI

当信任遇见真相:LLM评委中信任-真相的可分离性

LLM评委的信任评分与真实性判断高度耦合,受来源线索影响,不宜作为独立证据。

04:00
ArXiv AI

ReFrame:多模态大语言模型中证据引导的测试时安全对齐

提出免训练双智能体框架,重构多模态输入,在不修改模型下提升越狱防御与安全感知,减少过度拒绝。

04:00
ArXiv AI

大语言模型在软件工程与软件安全交汇处:以证据为中心的结构化综述与研究议程

大模型在软件工程与安全交汇处需以证据为中心的保障评估,而非单一基准分数。

04:00
ArXiv AI

从注意力掩码到惰性零向量令牌:面向令牌动力学的OAttention与O-Closure

提出以向量模长定义活跃度系数,门控注意力并令零向量令牌为惰性零元,实现零状态闭包,实验近乎无损。

04:00
ArXiv AI

基于线性时间序列数据差异图发现的根因分析

针对线性时间序列,用差异图发现定位因果系数变化导致的异常根因,并在模拟与真实数据中验证。

04:00
ArXiv AI

SENTRY:IT变更管理的确定性智能风险评估

以梯度提升树和混合RAG替代问卷,实现确定性风险评估,AUC0.87,高风险识别率3.25倍。

04:00
ArXiv AI

面向大规模旅行商问题的广义划分交叉的细粒度GPU并行化

提出GPX分区阶段的细粒度GPU并行化,在1万至2百万城市实例上实现48至625倍加速,提升GA求解器可扩展性。

04:00
ArXiv AI

凸集图上斯坦纳旅行商问题的统一分支定界搜索

凸集图斯坦纳旅行商问题:统一分支定界搜索,可证明有限终止与ε最优性;实验中平均最优间隙约28–30%。

04:00
ArXiv AI

解剖信息神经网络:在损失与架构中编码解剖先验,及导丝诱导主动脉髂动脉变形的SE(3)公式

提出解剖信息神经网络,将软硬解剖先验嵌入损失与架构;用SE(3)建模导丝致主动脉髂变形,以2D造影训练3D预测。

04:00
ArXiv AI

VIALS:生命科学中视觉工件解读的基准

生命科学视觉工件问答基准,161项任务,前沿模型难解,专家易答,凸显领域视觉推理短板。

04:00
ArXiv AI

AUSO:从内化到利用的动作级统一技能优化

AUSO通过渐进式动作级优化统一技能学习与使用,按动作受益度调整技能影响,提升性能与泛化能力。

04:00
ArXiv AI

先澄清后搜索:面向深度搜索的澄清基准与端到端要点恢复

提出“先澄清后搜索”基准,含518个真实查询实例,评估澄清问题对深度搜索的效用,支持可复现端到端评测。

04:00
ArXiv AI

大规模AI评分手写物理评估:分数一致性与奥赛队选拔结果

AI评分520份手写物理答卷,分数相关0.91-0.97,能复现奥赛五人队,但精细给分难,宜作第二阅卷人。

04:00
ArXiv AI

单一层级,两套系统:用于发现页排序与搜索页查询重构的语义商品ID

共享语义商品层级同时支持排序与查询重构,提升相关性和购买转化,减少搜索成本。

04:00
ArXiv AI

超越端到端成功:诊断长周期安全LLM智能体的失败

用检查点诊断长程安全智能体:引导使2.5 Flash观察率65.5%升至95.4%,但3.7相反,失败源随代际迁移。

04:00
ArXiv AI

基于优势聚合强化学习的EXL-50U实验标定环境X点靶磁位形控制

提出优势聚合强化学习,在EXL-50U标定模拟中实现X点靶鲁棒闭环控制,最差评分升至0.81,误差降20倍,支撑实时验证。

04:00
ArXiv AI

真实的课堂如何被代币化:原子学习模型(ALM)解析

ALM将两本数学课本机器拆分为1934个原子和4616条前置链接,自动生成6648道题,成本极低,但发现难度标注与实测无关等反直觉现象。

04:00
ArXiv AI

结构清晰但脆弱:论大语言模型在网络安全决策中的局限

LLM在网络安全决策中表现有条件,但能力脆弱,易受复杂度和提示措辞影响,且风险判断非单调。

04:00
ArXiv AI

LLM智能体时代的图工程:从个体智能到系统智能

图工程通过构建动态图结构组织任务与智能体实现从个体到系统智能的升级。

04:00
ArXiv AI

AID-Guard:委托代理效果的有状态授权

提出AID-Guard有状态授权协议,提交时重验请求,一次批准最多一效果,防重试恢复致重复副作用。

04:00
ArXiv AI

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

HIERA提出分层搜索空间规划,跨算子、库及自定义内核选择实现,提升GPU内核优化的有效性与采样效率。

04:00
ArXiv AI

DAMOS:通过显式失真定位学习失真感知的语音质量评估

现有语音质量评估缺乏失真位置监督。本文构建带帧级标注的数据集,训练定位模型生成失真线索,提出DAMOS框架,将定位信息融入MOS预测,在多个基准上优于现有方法,验证了显式失真定位的有效性。

04:00
ArXiv AI

$Z^2$-ACT:面向开放6G RAN的端到端可验证智能体意图控制

提出Z^2-ACT架构,集成零知识审计与零信任验证,在开放6G RAN中实现安全可验证的智能体意图控制,提升执行过滤与抗攻击性。

2026年8月21日
04:00
ArXiv AI

「从提示到扰动」:面向音频大模型语音越狱的自适应框架

提出自适应越狱框架,融合文本提示与音频扰动,统一评估级联与端到端音频大模型,显著提升攻击成功率。

04:00
ArXiv AI

混合强化学习与搜索的飞行轨迹规划

用强化学习预计算近优路径,约束求解器搜索空间,加速飞行路径优化,油耗偏差<1%,速度提升达50%。

04:00
ArXiv AI

G-ReAct:基于结构-状态协同进化的图引导深度搜索

提出G-ReAct框架,将深度搜索组织为图状态演化,缓解上下文遗忘与搜索漂移,仅需少量数据微调即可显著提升LLM深度搜索性能。

04:00
ArXiv AI

ReasFlow:基于知识的多智能体系统助力应用数学中以推理为中心的科学发现

ReasFlow是推理型科学发现的自主多智能体系统,具备内部验证与知识检索,自动生成论文,性能超基线。

04:00
ArXiv AI

工程设计与系统工程中数据集导航地图的框架与原型

针对工程设计与系统工程数据集分散问题,提出多维分类框架及交互式原型,揭示数据荒漠与绿洲,助力数据驱动研究。

04:00
ArXiv AI

沉睡的凯利

睡美人问题:事前与自身最优下注相同;渐近最优时,三一论者免受历时荷兰赌,二分一论者仍脆弱。

04:00
ArXiv AI

FiLoRA:面向可控特征依赖的聚焦-忽略LoRA

FiLoRA通过指令条件门控调节多模态模型内部特征依赖,实现可控且可解释的预测变化。

04:00
ArXiv AI

TrojanGYM:用于自适应RTL硬件木马插入的检测器在环大语言模型

TrojanGYM:LLM代理与检测器反馈自动生成多样化RTL木马,暴露盲区,逃避率68.75%。

04:00
ArXiv AI

基于张量分解的导频受限MIMO信道结构信息估计

针对导频受限信道,提出张量分解结合三维神经网络混合估计,以低秩补全解决欠定问题,性能显著优于现有方法。

04:00
ArXiv AI

DELOS:对比深度学习用于开普勒测光中的低信噪比盲凌星搜索

DELOS用对比评分搜索开普勒低信噪比凌星,合成数据精度99.3%,比BLS/TLS性能提升15.5%/11.25%,快3-5倍/74-80倍。

2026年8月20日
04:00
ArXiv AI

立场:AI推理智能体的合谋风险要求其市场决策需通过认证

推理智能体易合谋,思维链可被隐藏操纵,导致无证据的合谋结果,因此须基于行为观察认证方可部署。

04:00
ArXiv AI

立场:行为系统需要行为测试

AI行为系统需通过观察、扰动、解释来评估,而非仅看结果;应发展行为测试以研究智能体行为。

04:00
ArXiv AI

基于IEEE特征气体法的优化模糊逻辑变压器故障诊断方法

融合模糊逻辑与IEEE特征气体法,优化规则及CO/CO2分离,诊断准确率达98.6%,显著优于传统方法。

04:00
ArXiv AI

解题非绘图:面向奥林匹克几何图形推理的基准

新基准含954道奥赛几何题,评估发现模型解题强但绘图弱,平均编译成功率仅36%,表明数学推理不等于准确作图。

04:00
ArXiv AI

FraudBench:对基于策略的银行代理进行自适应欺诈压力测试

提出FraudBench基准,测试银行代理在对话中应对自适应欺诈的能力,初步评估显示攻击安全性仅49%-65%。

04:00
ArXiv AI

利用人工智能改善农村用药安全:一项范围综述

AI可改善农村用药安全,机器学习减少34%-80%错误,但存在基础设施和临床阻力。

04:00
ArXiv AI

RDFdL:将RDF与微分动态逻辑集成

提出RDFdL框架,集成RDF与微分动态逻辑,支持静态知识与连续动态推理,验证结果转SPARQL查询。

04:00
ArXiv AI

对抗性审查:有依据的智能体代码审查中的结构化分歧

对抗性审查用三个智能体,以有证据的结构化分歧进行代码审查,超越五智能体基线,证明有效协作无需复杂结构。

04:00
ArXiv AI

Redakto——面向大语言模型的隐身标签页

Redakto开源工具可在文本输入LLM前匿名化,去除个人身份信息,支持假名化,本地部署,法律医疗领域评估显示效用不降。

04:00
ArXiv AI

任意格中杰卡德距离的三角不等式

模赋值下任意格中杰卡德距离满足三角不等式;相对补分配格需超模与对数子模,超模性必要。应用于量子信息、机器学习

04:00
ArXiv AI

按设计可缓存?为局部性训练混合专家路由器以对抗边缘内存带宽墙:一项预注册的阴性结果与系统测量研究

混合专家推理受内存带宽瓶颈制约;训练路由局部性可减少缺失但困惑度超标,预注册阴性;结合无训练重路由最佳。

04:00
ArXiv AI

UMER:面向通用多模态检索,通过成对感知判别推理统一嵌入与排序

通过成对感知判别推理统一嵌入与排序,联合对比嵌入与判别排名,互蒸馏提升通用多模态检索,并达最优。

04:00
ArXiv AI

大语言模型在不确定性下的偏好推理

大模型偏好推理面临信息不完整、解不存在的不确定性,无法区分确定与不确定情形,验证中亦出现校准偏差。

04:00
ArXiv AI

透明传感器诊断管道搜索中的候选命运核算

提出候选命运核算框架,记录诊断搜索中的候选状态,识别被遗漏的候选,确保审计透明且性能不减。

04:00
ArXiv AI

轻量级多模态模型能否估计LLM推理性能?面向计算最优文档推理的研究

提出基准BudgetDoc和1B参数DRB预测推理性能并动态分配预算多数配置下匹配或提升F1成本大降