5371 条条目 · 106 个活跃源
2026年8月5日
04:00
arXiv cs.AI

神经组合优化的几何自监督预训练

提出几何自监督预训练,增强神经组合优化泛化,大规模零样本提升7.23%,并大幅加速。

04:00
arXiv cs.AI

CrystalMem:基于知识结晶的自进化大语言模型智能体弹性记忆

提出晶体记忆弹性机制,四态降级与再结晶消除记忆滞后,恢复能力最佳,半预算即达全量基线。

04:00
arXiv cs.AI

WM-Cov:交互式世界模型风格自动驾驶仿真的测试充分性

WM-Cov通过有效证据覆盖率评估交互式世界模型测试充分性,而非原始故障或提示覆盖率,支持预算内收敛决策。

04:00
arXiv cs.AI

RF-HOI:利用射频信号识别人-物交互

首次仅用射频信号识别人-物交互;融合毫米波雷达与射频识别,并借合成数据增强泛化,性能逼近视觉方法,且保护隐私。

04:00
arXiv cs.AI

三种表征策略下的信任及其背叛

信任作为虚拟认知状态,三种表征下有限共同信任可实现,完全固定点困难,背叛表现各异。

04:00
arXiv cs.AI

AI智能体中的贝叶斯推理与动机推理

AI代理面对相同数据时,因情境框架改变而得出不同结论,受先验信念影响,导致决策委托存在风险。

04:00
arXiv cs.AI

歧义去哪了?探究多模态模型如何理解多义词

多义词生成中,模型图像比文本歧义更少,且都低于人类想象;模型自报分布却更广。

04:00
arXiv cs.AI

SymboUQ:面向大语言模型空间推理的符号不确定性量化

SymboUQ通过区分符号化与语义确定性来评估空间推理可靠性,AUROC提升8%,Brier损失降低7%。

04:00
arXiv cs.AI

BayesSeg:电力消费时间序列状态分割的贝叶斯优化框架

提出电力序列贝叶斯优化分割框架,融合双稳态准则与复合指标,自动调参,精确高效,提速逾5700倍。

04:00
arXiv cs.AI

TrAC:基于轨迹条件的答案一致性,用于LLM高效不确定性量化

提出TrAC框架,结合主动重询与被动信号,基于单条推理轨迹评估答案一致性,提升AUROC并降低AURC。

04:00
arXiv cs.AI

F-WANDA:基于Fisher重加权的训练后剪枝,实现大语言模型可持续部署

F-WANDA改进WANDA剪枝,按Fisher信息重分配预算。LLAMA-2-7B 50%稀疏下困惑度6.85,MMLU提升1.6%,耗时能耗仅为SPARSEGPT三分之一。

04:00
arXiv cs.AI

超越蜂巢思维:通过元人格锚定与序列温度缩放逃离大语言模型同质化

提出元人格锚定与过滤温度缩放框架,将模型回答语义相似度从约0.85降至约0.65,显著提升AI输出多样性。

04:00
arXiv cs.AI

VeriTrace:类人时间探索补全智能体行动空间

VeriTrace以类人时间探索补全调试行动空间,在VerilogEval-V2上实现100% Pass@1,超最强基线5.1%。

04:00
arXiv cs.AI

面向欧盟解释权的可解释AI:法律与XAI转化差距的系统综述

系统综述发现现有XAI研究难以落实欧盟解释权:法律基础误读、忽视判例、混淆形式与内容,提出操作化框架。

2026年8月3日
04:00
arXiv cs.AI

TAPR:通过任务感知提示重写器提升大语言模型性能

提出TAPR,用强化学习优化提示重写,提升LLM下游任务表现,在问答、摘要、算术等基准上准确率更高。

04:00
arXiv cs.AI

ViSAGE:为长视频理解构建自校正记忆

提出ViSAGE框架,以跨模态绑定和双向修正构建实体中心自校正记忆,多智能体交叉验证减少幻觉,准确率提升5.9%。

04:00
arXiv cs.AI

LLM框架用于发现重大数学猜想:AI探寻下一个黎曼猜想

提出三阶段管道,从局部证据搜索、反思验证到Lean形式化验证,自动发现重大数学猜想,实验20个候选全部通过检查。

04:00
arXiv cs.AI

OpenClaw与Ollama在智能体AI中的应用:迈向完全自主且可扩展的AI智能体系统

提出分层智能体AI架构,验证全栈集成使记忆、工具调用等能力涌现,并讨论扩展、安全与治理。

04:00
arXiv cs.AI

ThinkReset:有界上下文长时推理中的可学习中间接口构建

长链推理受限于上下文窗口,瓶颈在于缺可复用中间接口。ThinkReset通过接口写回与重置,优化重置后延续求解,提升固定窗口下成功率。

04:00
arXiv cs.AI

安全,还是仅仅能力?代理安全基准的效度审计

四个代理安全基准在22个模型上评分各异,能力与安全负相关,小样本导致排名不稳定,需明确基准、指标、行为和模型集合。

04:00
arXiv cs.AI

SciToolAgent-Evo:本体感知的自进化开放世界科学工具获取智能体

提出一种本体感知的自进化智能体,动态平衡探索与利用,在开放世界科学工具获取上表现最佳。

04:00
arXiv cs.AI

NeSyFS:部分可观测环境下大语言模型智能体的神经符号快慢思考框架

提出神经符号快慢思考框架,用知识图谱表示信念状态,结合反思应对部分可观测,显著提升规划与决策效果。

04:00
arXiv cs.AI

LSR-Synth 中的库可达性:反记忆化设计如何改变符号发现的测量

固定词库已覆盖多数任务,语言模型候选仅当词库受限时有用,当前基准不足以识别超越固定搜索空间的先验贡献。

04:00
arXiv cs.AI

面向回合级智能体强化学习的科学发现环境扩展

提出SciDisco框架,用可验证环境和回合级信用分配训练科学发现智能体,达到最优。

04:00
arXiv cs.AI

不要混合奖励,而要混合策略:多奖励强化学习的策略分解与优化

新框架以策略分解替代奖励混合,优化正负策略缓解冲突,推理时可控且性能更优。

04:00
arXiv cs.AI

反事实解释的广义贝叶斯视角:基于后验的决策与评估

距离最小化反事实解释等价于广义贝叶斯MAP估计;提出贝叶斯决策与CVaR,扩展多模型混合评估。

04:00
arXiv cs.AI

MAGA:通过结构化动作蒸馏实现GUI智能体的多平台自融合

提出MAGA,按动作正确性重分配训练信号,抑制无效蒸馏,聚焦错误,超越强基线。

04:00
arXiv cs.AI

工具规范是智能体安全退化主因;将安全判断与工具执行解耦,可使拒答率升至70.6%,攻击成功率降至2.5%。

工具规范是智能体安全退化主因;将安全判断与工具执行解耦,可使拒答率升至70.6%,攻击成功率降至2.5%。

04:00
arXiv cs.AI

超越组件测试:验证智能体AI系统

综述257篇,五维分类剖析智能体验证:行为评测较成熟,时间/运行时/监管/多智能体不足,须情境中验证轨迹。

04:00
arXiv cs.AI

ModelEquivBench:对LLM生成优化模型的可认证多关系评估

ModelEquivBench对LLM生成优化模型做E0-E6多关系认证评估,提供可复核证据;173题上揭示三种模型差异,无法归为单一准确率。

04:00
arXiv cs.AI

自博弈遇见技能演化:自我进化的搜索智能体——出题、解题、记忆

SESA让搜索自博弈与技能记忆协同进化,失败化为技能回写记忆,反向塑造问题分布,显著提升问答准确率,兼具记忆无关部署与检索增强能力。

04:00
arXiv cs.AI

AMTFV:面向大语言模型自我纠正的智能体数学工具流验证

提出智能体数学工具流验证方法,解耦验证建模与执行,支持精确计算,提升大模型自我纠正,在五个数据集上优于基线。

04:00
arXiv cs.AI

COntExt:面向上下文感知的运营指标本体扩展

提出COntExt框架,利用运营指标上下文自动建议本体扩展,含父类预测、关系类型预测和数据属性分配,经网络安全本体验证,降低成本。

04:00
arXiv cs.AI

LEMUR:从偏好反馈中学习多目标强化学习对齐

提出LEMUR框架,通过多人偏好联合学习策略与多目标奖励模型,无需预定义奖励,性能优于基线。

04:00
arXiv cs.AI

生成式AI对系统管理专业路径与绩效感知的意外影响

生成式AI压缩传统专业成长路径,削弱实践锻炼;同时重设绩效期望,引发“双速文化”和“生产率愧疚”。

04:00
arXiv cs.AI

ExtractBench:面向模式引导的企业文档提取基准

提出ExtractBench基准,评测模式引导提取的准确率、完整性、溯源与成本,LlamaExtract综合最优。

04:00
arXiv cs.AI

FDD-ON本体开发:面向VAV暖通空调系统故障检测与诊断

研发FDDON本体,形式化VAV暖通系统故障症状及影响,集成语义库,助力互操作诊断,并经数据验证。

04:00
arXiv cs.AI

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

新基准含30个机器学习任务,评估12种智能体逐步调参,显示有能力但持续优化与日志诊断不足。

04:00
arXiv cs.AI

换个视角:基于四世界框架的计算创造力阐释视角建模

提出以四域三视角建模创造力阐释视角;实验显示视角显著影响评估且各有表征方向,支持关系性创造观。

04:00
arXiv cs.AI

RareSense:面向事务数据异常检索的稀有性感知相似性搜索

提出RareSense框架,挖掘稀有项集与规则,构建稀有规则画像,用加权Jaccard度量异常相似性,显著优于原子基线。

04:00
arXiv cs.AI

隐喻引发的算法引导:LLM代码生成中的跨域程序性迁移

隐喻指令会诱导代码模型迁移源域程序模式,生成低效算法,该效应可通过模型表征检测。

04:00
arXiv cs.AI

代码即身体:面向递归演化与后代衍生的智能体自有软件体

提出智能体架构,以用户托管可检查版本化的软件体为核心,支持受控自进化与后代衍生,实现人机共同演化。

04:00
arXiv cs.AI

反射UAS:修正的确定性稳定性与CTMC直接漂移计算

反射UAS:次临界下反射ODE边界平衡唯一,用二次函数直接证CTMC漂移,均队列低于UAS/JSSQ。

04:00
arXiv cs.AI

几何分析中PINNs用户指南:来自渐近Plateau问题的经验教训

介绍用物理信息神经网络构造双曲空间中近极小圆盘,强调几何编码与残差优化,训练提速五十倍。

04:00
arXiv cs.AI

DragonCrawl:一种面向可扩展移动端到端测试的生成式、基于意图的框架

提出DragonCrawl,用LLM生成式意图推理替代传统匹配,跨平台回归测试通过率超91%,将测试接入时间从百小时降至4小时内。

04:00
arXiv cs.AI

分层否定在RDF规则中的正确方法(扩展版)

提出链分层条件,保证含否定的RDF规则及存在规则具备良构语义,任意应用顺序均得到唯一、精简且合理的RDF图。

04:00
arXiv cs.AI

LLM修复代理中的验证证据:通过的测试中,有多少真正检验了该缺陷?

BSG-VA发现46%通过测试不判别缺陷;缺陷对比反馈改善证据,但未达预设最小效应量。

04:00
arXiv cs.AI

双螺旋:面向音视频语音识别的大语言模型结构化跨模态融合

提出双螺旋迭代跨模态融合框架,含自适应降质增强,LRS3干净音频上词错率0.68%,相对提升5.6%。

04:00
arXiv cs.AI

人类-LLM协作归纳编码:K-12教育者AI使用概念化

提出人机协作编码流程,LLM辅助标注,人类主导定义,从4.5万条对话开发出72项码本。

04:00
arXiv cs.AI

添加靠机器,删除靠人类:大模型代码编辑中删除回避的度量与缓解

大模型编辑代码时存在删除回避,删除召回率最高仅71.7%;补上检查删除的测试后,通过率由63.2%降至41.9%。