5932 条条目 · 106 个活跃源
2026年7月22日
04:00
ArXiv AI

用图神经网络近似系统发育树之间的SPR距离

研究用GNN近似SPR距离,训练后快速比较,解释87-90%方差,但外推至大树精度下降。

04:00
ArXiv AI

PRISM:面向高效神经网络加密的敏感性感知多项式剪枝

提出PSAP剪枝方法,联合优化权重、激活敏感性与旋转代价,在加密网络中大幅降低灾难性层数量,提升可靠性同时减少计算开销。

04:00
ArXiv AI

分布优先的人口模拟:非WEIRD LLM人物建模中的崩溃、校准与召回

独立LLM代理导致人群响应分布崩溃,分布优先法(VS)可校正但过度分散,提出一次性分布建模与预算路由器。

04:00
ArXiv AI

FSDBN: 通过动态脑网络实现前景感知的脑电-视觉对齐

FSDBN用动态脑网络和前景对齐实现脑电视觉解码,零样本检索top-1达69%。

04:00
ArXiv AI

利用扩散生成模型应对听觉注意解码中的数据不足问题

扩散模型合成EEG数据增强训练集,显著提升助听器听觉注意解码性能,缓解数据稀缺问题。

04:00
ArXiv AI

解码时文法:基于文法片段精化序的约束LLM生成

提出解码时文法,利用运行时环境动态约束LLM生成,消除未定义符号引用,保证语法语义正确且开销适中。

04:00
ArXiv AI

用AI查询多模态科学论文:盲人、低视力与明眼科学家的实践与偏好

采访盲人与明眼科学家,发现AI回答不全或错误致其放弃查询,并提供115条查询数据集。

04:00
ArXiv AI

钓鱼邮件检测的对抗鲁棒性:TF-IDF+逻辑回归与微调DistilBERT的比较研究

两种模型干净数据准确率超98%,对抗测试均降至约64%,表明干净数据准确率不能预测对抗鲁棒性。

04:00
ArXiv AI

HALLMARK:诊断大语言模型引用验证器的三种故障模式

HALLMARK基准发现,误报率而非召回率决定LLM引用验证器部署可行性,三种失败模式证实此点。

04:00
ArXiv AI

CPInj:揭示文本协作提示优化中的提示注入风险

提出CPInj攻击揭示TCPO的提示注入漏洞,现有防御无效,APAgg仅部分缓解。

04:00
ArXiv AI

波形的洞察:以透明优先的语音与音频智能平台Caption Studio

Caption Studio是透明优先的语音智能平台,采用三层架构实现转录、音频分析与集成,通过明确标注指标来源提高可靠性与可解释性。

04:00
ArXiv AI

基于主动加固的智能体应用数据泄露防护

提出预处理流水线,扫描加固验证多智能体系统,基本攻击100%消除泄露,压力攻击减少91%。

04:00
ArXiv AI

计算教育中团队问题解决练习的评估

比较聚类与LLM评估桌面演练团队表现,聚类可靠低计算量,GPT-5.2误差低。

04:00
ArXiv AI

MIRAGE:多尺度病灶信息表示与辅助引导的MRI对比增强

MIRAGE结合全局重建与病灶感知损失,在MRI对比增强中优于生成模型,但存在保真度与效用权衡。

04:00
ArXiv AI

连续步态识别中抗遗忘与抗推断的码分调制层

本文评估码分调制层在连续步态识别中的效果,可保持准确率并防御推断攻击,无需回放数据。

04:00
ArXiv AI

基于智能体的现实到仿真:使用视觉语言代理的物理世界建模

提出Agentic Real2Sim框架,用视觉语言代理自动将真实交互转化为可仿真场景,降低成本。

04:00
ArXiv AI

密集联想记忆的自由能景观

利用大偏差理论,得到密集联想记忆自由能泛函表达式,揭示了检索依赖初始状态并给出精确阈值。

2026年7月21日
04:00
ArXiv AI

RLHF偏好数据中的评估者状态偏差:一个审计框架

提出RLHF偏好数据中评估者状态导致的系统偏差,并构建审计框架与可检验预测。

04:00
ArXiv AI

仅需8个Token:弱到强离线策略RL的辅助分支方法

W2SPO通过插入短辅助段(8 token)实现弱到强学习,提升数学推理性能并加速训练3.55倍。

04:00
ArXiv AI

用于软毛绒伴侣情感触觉分类的轻量级1D CNN设计与验证

提出轻量1D CNN用于软毛绒伴侣情感触觉识别,公开数据集,模型达75%准确率,可20Hz实时运行。

04:00
ArXiv AI

Some Large Language Models Exhibit Consistent Risk Attitudes

04:00
ArXiv AI

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

揭示规划阶段注入攻击可级联放大,强模型更脆弱,同质管线存在盲点,推理模型可抵抗。

04:00
ArXiv AI

面向AI智能体系统的确定性重放

agrepl框架通过MITM代理实现AI智能体执行的确定性重放,保真度1.0,延迟降低98.3%。

04:00
ArXiv AI

生成式本体归纳:使用大语言模型从文档语料中发现领域无关的模式

提出GOI框架,自动生成结构化本体,在四个领域覆盖95-100%,优于通用模板。

04:00
ArXiv AI

用小型语言模型推动AI民主化:面向本地部署的结构化基准测试与参数高效微调

通过结构化基准测试和参数高效微调,证明子3B小型模型可作为本地专家胜任专业任务。

04:00
ArXiv AI

掩码扩散语言模型:智能体强化学习中强大且可操控的文本世界模型

提出MDLM作为可操控文本世界模型,双向锚点去噪超越大4倍LLM,零样本迁移获47%绝对提升。

04:00
ArXiv AI

JUMP:针对微调扩散语言模型的单次成员推断

提出JUMP方法,利用扩散模型并行解码特性,单次查询实现高效成员推断,AUC从0.82提升至0.90。

04:00
ArXiv AI

夏普利上下文剪枝:基于合作博弈的上下文重排序与剪枝方法

提出夏普利上下文剪枝框架,合作博弈视角,蒙特卡洛采样高效剪枝,多任务性能优异。

04:00
ArXiv AI

人机协作中的非均匀性原则

AI工作流中,人类监督需按非递减间隔放置,以提升满意度并减少重做和资源消耗。

04:00
ArXiv AI

LaCache:面向扩散大语言模型的精确缓存与精度自适应推理

LaCache通过无损缓存和混合精度量化,实现1.3~40.2倍加速,保持任务精度。

04:00
ArXiv AI

智能语音代理Jarvis

提出JarvisBench基准,验证实时语音中介可提升长期AI代理任务性能与用户理解,但效果依赖中介模型能力。

04:00
ArXiv AI

何时规划:学习在反应控制与深思熟虑规划之间选择

提出基于反应策略不确定性分数的强化学习方法,让智能体学会何时快速反应、何时需要规划。

04:00
ArXiv AI

FST.ai 2.5:面向奥运和残奥跆拳道决策支持、运动员数字孪生及联合会级分析的可解释与不确定性感知AI

提出可解释、感知不确定性的AI框架,整合运动员智能与竞赛分析,支持透明治理与个性化发展。

04:00
ArXiv AI

FUSAR-R1:用于SAR图像智能解译的大规模推理模型

提出FUSAR-R1模型,利用思维链推理与强化学习,在SAR解译任务中显著超越现有模型。

04:00
ArXiv AI

DL本体中认知保密策略下的易处理查询回答(扩展版本)

提出基于最小策略违反的CQE新语义,在DL-Lite_R中实现多项式时间查询回答并满足不可区分性。

04:00
ArXiv AI

约束锚定推理路径

提出CART框架,通过符号约束断言与回溯控制将错误雪球率从0.65降至0.14,提升多模态推理准确率。

04:00
ArXiv AI

基于语义-物理对齐的定制足矫形器闭环生成设计研究原型

提出TANS-FO原型,通过语义-物理对齐实现定制足矫形器闭环生成,快速合成可制造晶格鞋垫,压力预测高精度,初步观察显示短期舒适度改善。

04:00
ArXiv AI

RECON:对长上下文组合推理的智能体记忆进行基准测试

RECON基准评估长上下文组合推理,揭示系统在级联推理和回溯上的巨大局限,最强准确率仅22.4%。

04:00
ArXiv AI

TopoTuner:大语言模型的拓扑微调

提出拓扑引导的选择性微调框架,仅训练1-2%参数即达全微调性能,优于LoRA,可跨任务复用。

04:00
ArXiv AI

从超载到洞察:AI智能体如何助力科学家分析复杂数据

欧洲XFEL科学家开发AI智能体系统,应对大数据分析难题,提出知识检索与代码生成需求及设计建议。

04:00
ArXiv AI

当大型语言模型过度回答:测量与缓解基于LLM的硬件描述语言问答中的质量问题

LLM在硬件描述语言问答中常过度回答,提供冗余和冗长内容,多智能体框架可显著提升答案质量。

04:00
ArXiv AI

预期自由能作为ρ-POMDP的信念依赖效用

主动推理中预期自由能等价于信念依赖效用,自动平衡探索与利用,无需手动调参。

04:00
ArXiv AI

连续思维链模型训练:两种机制之比较

提出C-MTP直接监督压缩表示法,优于间接法,但长推理链任务性能下降65%,揭示连续思维链局限。

04:00
ArXiv AI

奖励驱动的大语言模型智能体工作流:融合POMDP路由与自我修正的自主决策

提出奖励驱动工作流,结合POMDP路由与自校正,在ALFWorld和WebShop上成功率提升24.5%。

04:00
ArXiv AI

PriorProof:形式化证明中技术新颖性的时点度量

PriorProof无需标注,通过证明依赖足迹和惊奇度评分,时点度量形式化证明新颖性,与专家一致性达69.7%。

04:00
ArXiv AI

Otap:面向智能体轨迹中规划与执行评估的结构感知最优传输

提出基于最优传输的轨迹评估方法,通过依赖图距离区分有效与无效规划,对重排序不变,容忍冗余步骤。

04:00
ArXiv AI

结合数值天气预报的傅里叶几何风电功率预测

提出融合SCADA与网格NWP的多模态框架,利用几何编码和傅里叶神经算子,显著提升风电预测精度。

04:00
ArXiv AI

证据接口如何塑造检索增强型阅读器对支撑信息的使用

证据接口揭示RAG中top-k分数隐藏的支撑链缺失或不兼容,检查完整支撑可解释性能差异。

04:00
ArXiv AI

AI代理行为诊断框架

提出分层归因框架,区分计算与行为调制层,强调行为来源归因对治理关键。

04:00
ArXiv AI

LoRA微调代码智能体时轨迹数据筛选的系统评估

系统评估轨迹数据筛选对LoRA微调代码智能体的影响,发现质量-数量权衡依赖规模,误差重试率是关键子维度。