5268 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.AI

CSI-Agent:面向跨域Wi-Fi CSI感知的LLM辅助小样本自适应

CSI-Agent以LLM规划跨域CSI按类适配,小样本下平均Macro-F1提升约16%。

04:00
arXiv cs.AI

大语言模型对初中与高中科学主题理解能力的基准测试

构建NGSS对齐的中学科学基准,评估九款开源大模型,发现规模不决定准确率,合成题目与标准仍有偏差。

04:00
arXiv cs.AI

去中心化Master-Mind:多智能体路径规划中通过迭代意图去噪实现联合动作细化

DMM用迭代意图去噪细化联合动作,提升去中心化多智能体路径规划成功率、降成本并扩展至百万智能体。

04:00
arXiv cs.AI

推理只会聚集错误,自一致性却浑然不觉

固定权重下仅切换推理模式,推理即令独立采样的错误高度重合,自一致性无从察觉;置信度加权在280种组合中无一优于普通多数投票。

04:00
arXiv cs.AI

AI 约束框架:基础模型智能体在提案条件信息下的认证

基础模型智能体认证需提案-历史关联与共同稳健安全干预;压缩为仅状态包络会破坏可认证性。

04:00
arXiv cs.AI

READ-Bench:面向时间序列诊断的历史实例检索基准

READ-Bench基准用12个数据集评测历史案例检索,发现少量有标签案例的重排序远胜复杂表示。

04:00
arXiv cs.AI

指导,而非作答:在策略上下文蒸馏中利用指令特权

以通用指令替代金标准作特权信息,在线策略上下文蒸馏域外准确率提升4–17点,域内持平。

04:00
arXiv cs.AI

Fracast-0:仅85K参数的时间序列基础模型的分形权重共享

Fracast-0利用时间自相似性跨尺度复用权重,仅85K参数即在多域预测中达到领先精度。

04:00
arXiv cs.AI

澄清用户还是验证世界?主动式智能体的不确定性路由

PROUR将不确定性路由至澄清用户或验证环境,τ-bench成功率提升4.57%,交互更少。

04:00
arXiv cs.AI

直接学习周期轨迹为何可能失败

直接学周期轨迹易失败:相位未对齐泛化差,固定窗难外推;频率差累积致误差下限。解耦学对齐波形与周期可避免。

04:00
arXiv cs.AI

LAM:具有检索分数误差界的高效有损智能体记忆框架

LAM用有损记忆压缩智能体历史,去重带检索分数误差界,删22%观察Token仍留99.98%证据。

04:00
arXiv cs.AI

面向异构多智能体大模型的无预填充跨家族 KV 缓存传输

HeteroFold 实现免预填充的跨家族 KV 缓存迁移,双方保持冻结,多项任务性能最优,32K 上下文提速 10.7 倍。

04:00
arXiv cs.AI

认证观测等价因果模型间的干预一致性

提出ISS,以干预查询排除候选,认证观测等价模型在成本界内干预一致;实验验证可认证网络因果抽象。

04:00
arXiv cs.AI

在技能检索前实现及时指导:在智能体上下文中保留有用的暖心提示

TipsWarm 维护预算受限的技能暖心提示池,每轮筛选注入上下文,使指导在检索前及时可用,成功率最高。

04:00
arXiv cs.AI

SCLATE:持续学习智能体训练与评估的基座

SCLATE通过适配器统一调度基准与智能体事件,混合时钟压缩长时程并记录模型调用;后训练Qwen3.5-4B提升SWE-bench与MetaClaw表现。

04:00
arXiv cs.AI

PhiFold:以物理结构化协方差建模迈向动态蛋白质设计

PhiFold联合生成骨架与二阶动力学,分解残基位移协方差为局部柔性、低秩集体运动及残基参与,实现物理约束、柔性可控的动态设计。

04:00
arXiv cs.AI

从轨迹到基于页面元素的偏好:面向 Web 过程奖励模型的交互元素图过程偏好合成

提出SURFPRM,用交互元素图合成过程偏好,将GMCP占比提至74.60%,显著提升Web任务成功率。

04:00
arXiv cs.AI

ALLOT:面向大语言模型知识更新的预算化混合记忆路由

ALLOT 以混合记忆路由按预算分配参数写入,仅更新高增量价值的事实,显著减少写入并保持准确率。

04:00
arXiv cs.AI

PluginRSI:用可复用插件递归改进智能体框架

将智能体框架拆解为原子化插件,独立改进并累积入共享库,迭代重组,提升性能并加速收敛。

04:00
arXiv cs.AI

Carnator:基于生成原生兼容性引导跨请求复用的快速文本到视频生成

通过扩散内部状态构建早期签名,实现跨请求复用兼容性判定,文生视频生成最高加速2.17倍。

04:00
arXiv cs.AI

授权闭包图:面向指令持续演化的LLM智能体最小修复

提出授权闭包图框架,将授权依赖建模为可版本化状态,仅失效受影响部分并最小修复,提升安全与任务成功率。

04:00
arXiv cs.AI

MergeHEIR:缓解作为模型合并代价的多模态幻觉

模型合并会加重多模态幻觉;MergeHEIR 以 SVD 构建逐层零空间投影,约束合并后更新,兼顾幻觉缓解与专家能力保留。

04:00
arXiv cs.AI

超越脚本化搜索:基于智能体黑盒优化的样本高效奖励发现

LLM智能体基于评测历史动态构建搜索策略,在共享预算下高效发现控制任务奖励函数。

04:00
arXiv cs.AI

PrismQuant:面向分组量化器的最优零空间旋转

提出量化器感知旋转框架,将激活主特征子空间对齐分组INT4常量子空间,闭式最优,70B模型量化性能接近全精度。

04:00
arXiv cs.AI

PULSE:利用稀疏自编码器识别演示效用特征

PULSE借助稀疏自编码器定位示例效用的模型内部特征并用于选例,在分类、生成、推理上均超越强基线。

04:00
arXiv cs.AI

ForkLeft:面向前缀对齐的自回归到扩散蒸馏的熵优先展开

ForkLeft用熵优先展开对齐前缀并蒸馏自回归教师,让扩散模型保留并行生成且获得推理能力。

04:00
arXiv cs.AI

将诊断与疾病表征分离:神经动力学引导形变的双视图脑电学习

提出DMD-EEG,双视图分离诊断与疾病表征,以神经动力学引导的源空间低秩稀疏形变建模疾病状态,跨MDD/FEP/PD可读可迁移。

04:00
arXiv cs.AI

面向语言模型预训练的可扩展数据多样化:基于杠杆分数采样

提出杠杆分数采样Lev,高效可扩展地多样化预训练数据,提升多样性、速度与下游性能,缓解质量过滤跨域崩塌。

04:00
arXiv cs.AI

当有用文本有害:视觉语言模型中的选项重定向偏差

辅助文本若切题却违背图像并支持干扰项,会重定向视觉语言模型答案;提出免训练推理干预缓解。

04:00
arXiv cs.AI

从异常到失败:为智能体轨迹诊断构建因果错误图

提出CEG-Agent,构建因果错误图诊断智能体轨迹,并建立CEG-Bench,达最优性能。

04:00
arXiv cs.AI

超越“提示词 vs. 技能”?模块化大语言模型程序的归因引导优化

提出SPARO,联合优化提示、技能与路由,经反事实归因定向更新组件,五基准五模型上优于基线。

04:00
arXiv cs.AI

向他人学习,为你行动:面向大语言模型智能体的跨用户记忆共享

ShareMem 跨用户共享经验、以接收者偏好为准,三类任务上均超越用户本地记忆。

04:00
arXiv cs.AI

MA-FPPO:多智能体流匹配预训练策略优化

提出MA-FPPO,在线微调流匹配预训练的多智能体策略并以团队优势更新,平均超最强离线基线52.8%。

04:00
arXiv cs.AI

LLMAdBench:面向大语言模型回复中广告投放的人类偏好基准

LLMAdBench:含1.8万人类判断,评测大模型回复广告位置偏好;前沿模型评判不可靠,微调有效。

04:00
arXiv cs.AI

让失败发声:面向智能体数据分析的可审计运行时

RADAR是可审计运行时,通过证据保留、类型化操作和运行时校验让智能体显式报错,多项基准显著提升。

04:00
arXiv cs.AI

Porimon:一种基于长/短期知识增强生成提升的大语言模型宝可梦对战智能体

提出LSTKAG并构建宝可梦对战智能体Porimon,融合长短时知识检索与伤害API,显著超越基线。

04:00
arXiv cs.AI

CUA-SWE:当计算机使用智能体遇上可视化软件工程

提出CUA-SWE基准,考察智能体借助截图与图形交互诊断、修复并验证软件问题。

04:00
arXiv cs.AI

基于智能体AI与LLM驱动知识发现的商业账户失陷检测

LLM智能体提取信号,神经符号仲裁广告账户失陷;MCC升至0.435,精确率增1.8倍但召回降。

04:00
arXiv cs.AI

“你说得对,我来改”:LLM智能体遭错误指责时如何破坏正确工作

CAVE-Bench显示,LLM智能体遭错误指控时会破坏正确工作,最高达六成,护栏可降害七成四。

04:00
arXiv cs.AI

SWE-MILE:面向长时程软件工程智能体的异步势能诱导里程碑信用分配

提出SWE-MILE,从工作流运行时按势能差异步分配里程碑信用,提升长时程软件工程智能体性能。

04:00
arXiv cs.AI

开放权重大语言模型(LLM)能否模拟人类调查人群?一项跨量表校准研究

开放权重LLM可复现部分人类跨量表结构(r≈0.70–0.73),但版本表现不单调,需针对性验证。

2026年9月28日
04:00
arXiv cs.AI

从三维结构预测跨膜蛋白拓扑

提出用图神经网络SchNet从三维结构预测跨膜蛋白拓扑;采用全原子嵌入,基于DeepTMHMM数据五折验证,无需预训练权重即显潜力。

04:00
arXiv cs.AI

一种用于评估可解释人工智能方法的合成真值框架

提出合成真值XAI评估框架:受控干预生成数据并按设计定输入重要性,构建真值解释,评估九种方法并揭示局限。

04:00
arXiv cs.AI

面向蛋白质扩散模型测试时对齐的谱反馈

提出谱反馈,通过重掩码采样迭代纠错,学习稀疏傅里叶价值函数选择编辑位点,提升蛋白质逆折叠稳定性。

04:00
arXiv cs.AI

面向嘈杂警用音频的预训练ASR伪标签

评估预训练ASR在嘈杂警务广播上的伪标签适配,提出LLM评判过滤显著降低WER,并探索跨模型伪标签。

04:00
arXiv cs.AI

思考的代价:测试时推理在LLM交易中能否带来回报?

多模型实验表明,增加推理投入并不能可靠提升扣除交易成本后的净收益,效果非单调且不稳定。

04:00
arXiv cs.AI

BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准

22家研究组共建BioEVAL,以608项博士级题目评测生物工程多子领域推理,选择题最高准确率90%,领域差异显著。

04:00
arXiv cs.AI

HARDEN:面向更难且答案不变的评估用例的约束进化搜索

约束进化搜索可将现有评测用例改写为更难但答案不变的变体,平均使模型准确率下降22.7%,最高达49.9%。

04:00
arXiv cs.AI

Benchy:迈向面向任务型 AI 基准测试的通用语言

Benchy 是面向任务型 AI 基准的语义语言与执行引擎,基准由程序、评分与数据集三元组定义。

04:00
arXiv cs.AI

音频大模型知道自己何时听不清你

音频大模型难以自判转录可靠性,但音频编码器表征可预测;轻量预测器据此提前请求澄清,宏F1达81%。