5801 条条目 · 106 个活跃源
2026年9月9日
04:00
ArXiv AI

何时以及为何大语言模型因果先验有效:面向摊销因果推断的闭环先验选择

提出闭环先验选择框架,将大语言模型因果图注入因果推断模型,主域误差降至2.75倍且泛化提升,变手动调试为可验证选择。

04:00
ArXiv AI

SSP-DMGTimeNet:面向车辆队列时空轨迹预测的物理约束学习

提出物理约束学习框架,融合因果注意与串稳定性损失,在保证轨迹精度的同时抑制扰动传播,实现稳定预测。

04:00
ArXiv AI

利用SleepFM-2从两百万小时睡眠中学习可迁移的人类生理表征

基于28万余例、超两百万小时多模态睡眠记录预训练的模型,提升疾病预测与睡眠评分,可迁移至可穿戴与主观睡眠。

04:00
ArXiv AI

VST:用于可审计的智能体间Alpha发现的可验证结构化传输

将智能体通信结构化,实现可审计性而非精度;单次实验仅VST获正收益,但需谨慎解读。

04:00
ArXiv AI

审计检索增强生成系统的层次一致性框架

提出层次一致性框架,从知识库、检索上下文、生成答案三层审计RAG,识别矛盾证据并归因,使证据可检查。

04:00
ArXiv AI

风险不等于评审价值:有限评审预算下的错误答案暴露

论证评审应优先考虑可修复且高影响的答案,而非仅依据风险排序;新指标PRRE在20%预算下将残余暴露从0.881降至0.716。

04:00
ArXiv AI

早期编码,后期使用:Transformer在何处开始利用推断出的对话伙伴专业水平

模型在早期层即可解码伙伴专业水平,但该信息直到网络后半段才因果影响输出,间隔显著。

04:00
ArXiv AI

PhysMAS:基于物理的多智能体组合式4D高斯合成

提出PhysMAS框架,用多智能体分配材质并执行物理仿真,合成异构多部件及多物体动态场景,无需SDS优化,更高效且物理合理性更强。

04:00
ArXiv AI

可审计的符号-RAG-生成式AI架构,用于目标导向对话编排

提出GRACE架构,结合符号状态与RAG,在保证用户效用下最大化业务目标。双语测试中状态转换准确率84.9%,证据精确率91.6%,单调性100%。

04:00
ArXiv AI

EmoMed:用于多模态医疗支持并具备实时信息检索的情感感知智能体

感知情绪的多模态医疗智能体EmoMed,结合实时检索维持医学准确,情感自适应回应优于中性基线。

04:00
ArXiv AI

RAFM-SER++:面向监控系统实时行为监测的轻量级多模态情感识别框架

提出轻量级多模态情感识别框架RAFM-SER++,采用非对称残差注意力融合,减少60%参数且推理更快,在IEMOCAP和ESD上精度超越现有基线。

04:00
ArXiv AI

基于Transformer的三维流场预测中的距离感知注意力与壁面距离专家路由

提出距离感知注意力与壁面距离专家路由,用于Transformer三维流场预测,显著降低压力速度误差。

04:00
ArXiv AI

弹性视界:在智能体强化学习中发现有效交互边界

提出交互边界假说,用成功轨迹长度第90百分位动态调整上限,稳定在饱和区,实现最优成功率并节省25%令牌。

04:00
ArXiv AI

人类道德判断相似的大型语言模型,实则隐藏着不同的动机归因

LLM能复现人类对举报者的道德评价,但动机归因不同,验证需考察心理模式而非平均一致性。

04:00
ArXiv AI

CIT-CAD:基于约束意图树的CAD代码生成与验证

基于约束意图树引导CAD代码生成、验证与修复,超越几何匹配。

04:00
ArXiv AI

从模拟公民到模拟审议:代表性与交互的挑战

基于人口学的LLM审议不能可靠复现民意,互动对立场变化非必需;人口模拟仍需验证,但能呈现双方论证。

04:00
ArXiv AI

FinCUABuild:智能体能否为动态金融计算机使用构建可靠基准?

FinCUABuildAgent自动构建动态金融CUA评测任务,严格合格率31.3%,远超现有方法。

04:00
ArXiv AI

面向实时代码仓库数据分析的工具增强型GPT-4聊天机器人

提出工具增强GPT-4聊天机器人,先解析查询、选用工具再生成回答,提升实时仓库数据分析可访问性。

04:00
ArXiv AI

AgentIdeaBench:智能体时代的科学构想评测基准

新基准AgentIdeaBench对比静态与主动探索,评测33个模型跨学科科学构想:主动探索空间更大,且收益偏向强模型。

04:00
ArXiv AI

无需引擎的评分:面向生成式引擎的确定性、抗操纵内容评分之端到端验证

用对抗性证伪门端到端验证生成引擎内容评分:抗操纵增益有界(≤6分),但仅适作质量过滤,非引用预测器。

2026年9月7日
04:00
ArXiv AI

一种基于移除的测试时方法以提升大语言模型的忠实性

提出测试时移除方法:删除解释未提及的概念后重新查询,减少遗漏影响,显著提升解释忠实度,且无需修改模型参数。

04:00
ArXiv AI

迈向概念的通用语言:综述

本文提出程序可作为概念的通用表示,并综述相关概念学习模型,评估其对通用表示语言的贡献。

04:00
ArXiv AI

IPGeoAI:基于Transformer与LLM语义融合的地理定位

IPGeoAI利用Transformer编码IP子网,融合LLM提取的AS语义,显著提升城市级定位精度,准确率提高6%,覆盖达100%。

04:00
ArXiv AI

ResLearn-XR:面向扩展现实的网络流量与体验质量感知建模的残差学习

ResLearn-XR用残差学习两阶段预测XR流量与QoE风险,SMAPE最高降17.84%和87.8%。

04:00
ArXiv AI

极度稀疏监督激发推理能力

后训练中仅用0.05%的极稀疏监督即可媲美甚至超越全token训练,有效激发推理能力。

04:00
ArXiv AI

τ^τ-Bench:面向端到端、真实智能体构建的环境

新基准测试智能体构建能力,最强配置仅通过23.9%,专家达82.2%,失败模式与人类开发者一致。

04:00
ArXiv AI

La Agente 'Optima:迈向智能体自驱动实验室

提出大语言模型智能体框架Optima,管理贝叶斯优化实验;可自动纠错、降本增效,拓展自驱动实验室应用。

04:00
ArXiv AI

SiLR:面向LLM工具智能体的保结构准入与过程奖励

SiLR以分支级违规态产品序准入替代标量门控,证明标量投影不可靠,显著提升恢复率与物理安全性。

04:00
ArXiv AI

利用不完美恢复进行数据可用性攻击

针对CUDA攻击质量与效果矛盾,提出IRP方法,兼顾高图像质量与强毒化效果,在监督与自监督学习下优于八种基线并抗五种防御。

04:00
ArXiv AI

意图漂移下自适应推荐的持续图记忆

提出持续图记忆框架,将知识图谱视为可写记忆,融合语义与经验记忆,仅用记忆更新适应意图漂移,提升推荐。

04:00
ArXiv AI

面向嵌套企业模式的自然语言转SQL成本感知智能体架构及新基准

提出新基准与成本感知智能体架构,在900条查询上准确率91.7%,领先次优基线54.6个百分点

04:00
ArXiv AI

ERPBench:评估LLM代理在竞争性市场生态中的企业决策

ERPBench用六轮ERP模拟测试LLM代理决策,发现不同竞争生态下模型排名不一致,仅有21/100任务获胜者相同,支持配对评估排名转移。

04:00
ArXiv AI

PLUME:基于共享子空间低秩用户调制的大语言模型参数高效个性化

PLUME通过共享子空间和轻量调制矩阵实现LLM个性化,参数减少95%以上,性能媲美强基线,支持大规模用户。

04:00
ArXiv AI

模型退役对生物医学AI出版物构成可复现性风险

约四成生物医学论文所用大语言模型已退役或即将退役,威胁可复现性,模型退役应作为核心报告与保存问题。

04:00
ArXiv AI

SQL-Zero:自进化文本转SQL

无需人工标注,以数据库执行为真值,用挑战者-求解者自博弈训练;BIRD提升6.6至7.3点,迁移能力取决于模型规模。

04:00
ArXiv AI

训练你所部署的:生产编码的令牌保真后训练

提出保真训练框架与C-DPPO解决令牌控制误差,较标准DPPO提升3.0点。

04:00
ArXiv AI

Aplaud:面向用户特定大语言模型的自适应个性化低秩分解

提出Aplaud框架,通过共享低秩基与紧凑用户修正分解实现大模型高效个性化,降低参数成本,优于现有LoRA方法。

04:00
ArXiv AI

FinalityBench:延迟与冲突的金融最终性下智能体决策的效果级基准

提出最终性基准,按资金效果评估延迟冲突下智能体决策;语言模型无提示即学会最终性门控,等同手工规则。

04:00
ArXiv AI

基于低秩自适应空间注意力图神经网络的移动传感PM2.5时空浓度预测

提出空间注意力图神经网络,融合低秩自适应与聚类,实现PM2.5细粒度预测与热点识别,优于基线模型。

04:00
ArXiv AI

DCFA:基于大语言模型多智能体系统中故障推理的双视角因果启发式归因方法

提出无训练框架DCFA,融合全局因果定位初始关键错误与局部反事实推理,步骤准确率最高提升8.27%。

04:00
ArXiv AI

ElderBench:面向老年人自主移动代理的基准测试

首个面向老年人真实场景的移动GUI代理基准,发现老年人口语化指令导致主流代理性能显著下降,并剖析语言特征对失败的影响。

04:00
ArXiv AI

面向移动边缘智能体AI的扩散语言模型:基础、应用与挑战

扩散语言模型以并行精修实现灵活质量-延迟权衡,助力移动边缘智能体降低时延开销、增强鲁棒性;综述基础、应用与挑战。

04:00
ArXiv AI

DODR:潜空间中的确定性算子驱动推理

提出DODR,用潜空间确定性矩阵算子替代token采样推理,形式化皮尔士三分推理,具备完备性、收敛性与零幻觉保证。

04:00
ArXiv AI

ProtLingo:基于条件记忆与专家路由的高效蛋白质语言建模

ProtLingo结合条件记忆与稀疏专家路由,以小型骨干实现蛋白质高效建模,参数效率高且性能有竞争力。

04:00
ArXiv AI

MedFlow:面向医学时间序列合成的类别感知多尺度生成

提出类感知多尺度流匹配模型,用于医学时间序列合成,增强少数类特征,提升下游预测性能。

04:00
ArXiv AI

层级控球感知图指针网络用于传球接球者选择

提出层级控球感知图指针网络,融合图交互、事件上下文与控球动态,提升传球接球者预测精度。

04:00
ArXiv AI

这是谁的记录?个性化多模态模型中记录使用的诊断与授权

提出记录授权判定,诊断视觉记忆错绑;预授权能大幅降低不安全记录使用,但会牺牲正召回。

04:00
ArXiv AI

面向多站点工业预测性维护的长时程Transformer分位数故障预测

TQRNN30d框架结合分位数状态与多流融合,30天故障预测F1达79.97%,领先18个基线,但跨站点泛化未验证。

04:00
ArXiv AI

CPR-IE:压缩-预测-资源智能效率度量

提出非普适的压缩预测资源智能效率度量,用于部署约束下系统比较,具帕累托一致性与稳健性。

04:00
ArXiv AI

MM-IFEval-Pro:面向视觉语言模型的多语言与抗攻击指令遵循基准

提出多语言抗攻击多模态指令遵循基准MM-IFEval-Pro,覆盖中英及指令劫持,并用强化学习提升模型表现与跨语言泛化。