5907 条条目 · 106 个活跃源
2026年8月6日
04:00
ArXiv AI

集成自适应经验回放与在线不确定性估计的安全Actor-Critic最优控制

集成不确定估计、安全滤波与经验回放,在极端测试中零碰撞且全部到达目标,优于消融方案。

04:00
ArXiv AI

视觉-语言-动作模型中用于长时程规划的显式语言记忆

提出显式语言记忆分层VLA,将观测转文本记忆,解耦高层推理与低层控制,提升长时程任务成功率与鲁棒性。

04:00
ArXiv AI

ArtAnno:通过LLM智能体驱动的双向人机增强标注艺术作品隐式语义

提出双向人机增强闭环框架,实现ArtAnno系统,提升标注效率、积累知识并减少信息查找验证成本。

04:00
ArXiv AI

SciCode-Verified:基准缺陷如何低估了语言模型的科学编程能力

修正SciCode基准缺陷后,模型科学编程准确率大幅提升,原停滞源于基准而非能力。

04:00
ArXiv AI

火星预报:将AI天气基础模型迁移至行星大气

将地球天气模型迁移至火星,微调后能捕捉昼夜周期并预测10天大气动态,支持任务与防尘暴。

04:00
ArXiv AI

小型语言模型中口头化不确定性的可证明局限与认证延迟

研究小语言模型口头化置信度,证明校准局限,提出Clopper-Pearson认证延迟;经验显示仅少数模型可通过高风险预算认证。

04:00
ArXiv AI

GRALS:图卷积网络引导的冗余感知局部搜索求解最小顶点覆盖

提出图卷积引导的冗余感知局部搜索框架,346个基准实例中335个达已知最优,优于最强基线。

04:00
ArXiv AI

梯度免疫:零空间抵御恶意微调

单向安全门以零空间立方层和逆适配器,在发布时保留安全组件,微调阻断有害梯度,攻击成功率维持发布前。

04:00
ArXiv AI

RepairFormer:使用Transformer自动修复结构化输入

提出RepairFormer,基于Transformer修复结构化输入,采用格式标签与边界定位,保留内容,修复率88%,恢复率94%,速度提升5倍。

04:00
ArXiv AI

用于多迭代推理的链式递归语言模型

提出链式递归语言模型,通过多次调用同一模型并传递简洁摘要与中间产物,分解长上下文任务,提升多跳推理准确性。

04:00
ArXiv AI

教Nemotron学希腊语:挖掘语料、适配检索、面向专业领域生成并接地气的现代希腊语方案

将Nemotron检索栈适配现代希腊语,微调后nDCG@10从0.362升至0.835,生成正确率从29.4%升至66.9%,并推出希腊语RAG基准HERA。

2026年8月5日
04:00
ArXiv AI

Nova:面向深度学习的端到端MLIR编译器

Nova是自动化端到端JIT编译器,通过融合操作与优化内存,性能超PyTorch和XLA,内存节省29%,可训练更大模型。

04:00
ArXiv AI

重新审视经典思想实验以衡量人工智能安全中的意识

通过CCE框架重访经典思想实验,区分外在行为与内部组织,指出未压缩与紧凑系统行为相似但意识度不同,关乎AI安全。

04:00
ArXiv AI

利用上下文特定知识增强LLM以缓解中小企业错误信息:基于RAG的建模与分析

提出VectorRAG和GraphRAG建模,在多种LLM上测试,证明能减少幻觉和错误信息,提升中小企业决策可靠性。

04:00
ArXiv AI

CoT-Core:通过思维链感知的核心集选择加速大语言模型评估

提出CoT-Core,利用思维链轨迹按逻辑等价聚类,免训练加速评估,降本保准。

04:00
ArXiv AI

采用检索增强生成流程的大语言模型优化与约束建模

通过合成数据集与检索增强生成流水线,大模型优化建模准确率大幅提升(NL4OPT由40%升至72%),无需微调即可实用。

04:00
ArXiv AI

批量LLM服务的请求级能耗归属

提出JouleShare框架,用Shapley值精确测量请求能耗,发现token分摊误差大,校准模型可将误差从0.44降至0.12。

04:00
ArXiv AI

Motif-Mamba:基于网络模体改进的Mamba长序列建模

提出一种模体约束低秩循环路径的Mamba改进模型,增强跨维度交互且保持线性时间,实验全面优于基准。

04:00
ArXiv AI

H+嵌入:以上下文相关短语统一全局与词元级检索

引入H+嵌入,用上下文相关短语作检索单元,兼顾全局与词元级效果,减少13.7%向量,提升检索质量。

04:00
ArXiv AI

SIRIN:用于检测检索增强与记忆 grounding 的 LLM 系统中上下文幻觉的统一工具包

SIRIN 统一三种检测范式与查询可答性判断,支持白盒/黑盒及响应/跨度级检查,用于检测 LLM 上下文幻觉。

04:00
ArXiv AI

RAG-TESTER:检索增强大语言模型的自动化端到端测试

提出了RagTester,一种RAG系统自动化端到端测试方法,覆盖检索与生成。在24种配置、7.2万次执行中检测出21633个失败,比基线多6.6%。

04:00
ArXiv AI

以小策略模型个性化大型语言模型智能体

提出FABLE:在冻结LLM代理外设轻量策略层,用贝叶斯汤普森采样在线学习用户偏好以优化代理执行决策

04:00
ArXiv AI

面向企业编码代理的共享组织记忆:系统设计与部署快照

将经验捕获融入编码流程,经审核形成可复用问答记忆,供未来代理检索,应对企业专有知识缺失问题。

04:00
ArXiv AI

语言上下文在视觉-语言模型中重编码视觉表征

视觉语言模型依语言提示重编码视觉表征:识别目标对象并放大属性,因果干预证实影响响应,视觉动态支持语言。

04:00
ArXiv AI

LLM代理能否进行竞争性定价?面向代理商务的动态多属性拍卖基准

提出动态多属性拍卖基准,测试11款前沿大模型代理:获客与盈利排名不同,最强利润也不足最优三分之一。

04:00
ArXiv AI

AgentStream:自进化大语言模型智能体在流式任务下表现如何?

提出流式评估框架:自进化智能体可靠性因任务流而异,收益受模型能力制约,无方法全场景占优。

04:00
ArXiv AI

TRACE-TS:基于归因可追溯的传感器-语言推理用于人类活动理解

提出TRACE-TS框架,以归因证据构建可追溯推理,在七项穿戴基准中取得最佳准确率与F1。

04:00
ArXiv AI

基因本体引导的组织病理图像空间基因表达层级预测

提出MSGR,用基因本体层级引导病理图像的基因表达预测,优于扁平解码;增益源于生物本体结构,非单纯层级分解。

04:00
ArXiv AI

学习协调符号工具:面向可验证平方和证书的LLM智能体

利用符号工具与验证器反馈,LLM智能体在加权平方和分解上验证成功率达78.96%,九项任务宏精度91.75%。

04:00
ArXiv AI

RMSWeb:面向智能体强化学习的反思、失败模式挖掘与Salvage-DS方法

提出RMSWeb,含反思重试、失败模式挖掘和Salvage-DS,减少动作步数,在多个网页任务上较SFT提升1.2-7.7分。

04:00
ArXiv AI

压缩前先诊断:面向LLM服务轨迹的预测无关瓶颈见证精炼

提出BPW框架,用非代表性工作负载保留各瓶颈证据,经候选提名、覆盖优先构建和直接测量验证,以紧凑集达诊断门限,性能领先16种策略。

04:00
ArXiv AI

基于掩码的先验比查询键初始化更持久

掩码初始化可持久注入结构先验,修正变换器在布尔外推上的错误泛化,并提升低数据算术性能。

04:00
ArXiv AI

Ekova:面向自我探索对话的人格支持智能体

提出人格支持新范式,构建中文自我发现数据集与多角色系统,集成Ekova智能体,性能平均提升16.3%。

04:00
ArXiv AI

TaPR:面向反馈条件代码生成的测试感知策略优化

提出测试感知策略优化框架,将执行反馈转为密集回合奖励,使多轮代码修复成功率提升2.44个百分点,并解耦首轮生成与多轮修复能力评估。

04:00
ArXiv AI

贝叶斯反射:人工智能的预测编码引擎

提出贝叶斯反射框架,整合生成模型、误差最小化与主动推理,实现可扩展类脑持续学习与决策。

04:00
ArXiv AI

HyperAgent:基于工具-模式超图进行规划与执行的工具使用LLM智能体

提出工具-模式超图建模工具关系,HyperAgent据此动态规划执行,在AppWorld上提升任务完成率并减少API调用、交互和令牌消耗。

04:00
ArXiv AI

自组织数字电路

受生物自适应启发,用拓扑掩码Transformer配置逻辑电路,实现从零自组装、故障快速重路由,对软错误近完美恢复且泛化到更宽电路。

04:00
ArXiv AI

ISEE:数据库字段的交互式语义增强

该系统通过评分与用户协作,为数据库字段补充语义,降低认知负荷,提升描述质量与下游任务性能。

04:00
ArXiv AI

PULSE:面向时空知识图谱工程的可执行合约语言

PULSE是可执行合约语言,将时空知识图谱操作角色与写效果局部化,提供安全属性保证,并验证轨迹一致性。

04:00
ArXiv AI

预测集合论:一种具有可操作核心机制的认知架构生成框架

预测集合论以最小操作集生成认知架构,推导核心功能,为不完备信息与不可逆风险下的内部一致性提供设计规范。

04:00
ArXiv AI

BAP-SQL:面向智能体文本到SQL的预算感知观测规划

BAP-SQL将观测形成作为预算控制,提升紧预算成功率、减少词元,但收益随能力与预算上升而减弱。

04:00
ArXiv AI

迈向社会化人工智能的科学发现新范式

社交化科学智能范式将AI作为组织基础设施,连接知识、推理、实验与人类判断,使发现更可追溯、可复现、可累积。

2026年8月3日
04:00
ArXiv AI

混合分词与串并行解码赋能跨域序列推荐

提出GenCDSR框架,采用跨域混合分词与串并行解码,准确率提升1.5%,延迟降低85.1%。

04:00
ArXiv AI

面向异构文档知识图谱构建的本体引导去重感知抽取层

提出本体引导去重抽取层,基于Qwen模型两遍抽取和五阶段精炼,搜索召回率从70%提升至95%,无错误合并。

04:00
ArXiv AI

AI能评估AI科学家吗?基于自动多模型评审的自主研究生成系统基准测试研究

提出多模型评审基准,评估AI科研系统;FARS显著领先,Gemini与Claude评审一致可靠。

04:00
ArXiv AI

它思考有多难?分析LLM思维链轨迹中的步级推理能量

提出SARE按步度量推理能量:非均匀分布,错误轨迹关键步能量更低,其特征超越输出置信度。

04:00
ArXiv AI

真实世界临床诊疗中的推理:大语言模型为何尚不能安全用于自主临床决策支持

大模型虽通过医学考试,但缺乏临床评估保真度,自主分诊难以在不确定性下收集信息,漏诊高危,不安全。

04:00
ArXiv AI

基于STL-GO的具有时空与拓扑约束的多智能体规划

针对时空与拓扑约束的多智能体规划,提出STL-GO的MIP与SMT编码,并在多无人机搜救中验证。

04:00
ArXiv AI

EarlyDx:以入院锚定的急诊诊断证据支持开放式生成基准

提出急诊早期诊断基准EarlyDx,基于MIMIC-IV超15万病例,仅用入院时证据,评估表明现有模型推断能力不足。

04:00
ArXiv AI

模型还是框架?面向交互的智能体失败定位分类法

现有评估归因于系统整体,掩盖故障源头。提出交互中心分类法,按交互边界与责任方定位41种失败模式,明确模型或框架修复归属,跨架构适用。