5268 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.AI

问卷引导的家庭智能电表数据电器用电分解

提出问卷引导的无标签分解系统,将智能电表数据分为9类电器,在多数据集上误差最低,并给出节能建议。

04:00
arXiv cs.AI

扭蛋解码:通过指令遵循激发多样化生成

Gacha解码把多样性视为指令遵循问题,结合外部随机数实现高质量多样生成,并随模型能力增强而提升。

04:00
arXiv cs.AI

PPO-HRAP:面向风险可控交易的混合市场状态感知策略的近端策略优化

PPO-HRAP融合可解释市场状态先验,SPY回测总收益27.6%,最大回撤从34%降至18.5%。

04:00
arXiv cs.AI

PRISM:衡量与优化多模态类比的范畴论框架

提出PRISM,用范畴论拉回分数量化多模态类比关系对齐并迭代优化图像,提升隐喻一致性,但偏向视觉繁杂构图。

04:00
arXiv cs.AI

生成溯源先于行为归因:审计合成语音研究对象

提出生成溯源基座,审计合成语音研究对象,认为生成溯源是行为归因的必要非充分条件。

04:00
arXiv cs.AI

验证主张,而非分数:模块化智能体的基于证据的验证

提出主张级验证审计,以证据替代评分,用oracle策略、组件替换与验证器测试定位价值损失。

04:00
arXiv cs.AI

AiSearch:基于视觉语言模型的交互式多模态搜索

提出AiSearch,基于VLM零样本实现图像视频自然语言搜索,支持反馈优化与多模型基准选择。

04:00
arXiv cs.AI

对比注意力缓解脉冲Transformer的频谱偏差

揭示脉冲Transformer高频损耗源于低通滤波,提出SCA对比注意力增强高频且通用高效。

04:00
arXiv cs.AI

NextMe-800:从数月第一人称视频中预测个人行为

发布约800小时、单人126天的第一人称数据集NextMe-800及预测基准NextAct,评估模型对个人行为的预测能力。

04:00
arXiv cs.AI

从后验集中现象重新思考基于概率的强化学习

揭示概率奖励长推理时后验集中致奖励难区分,提出RLCPR提升稳定与效率,七项基准六项超越基线。

04:00
arXiv cs.AI

后训练中的锐化税

后训练锐化现有行为,单次准确率升但解覆盖降;预训练模型配轻量推理壳,测试预算充足时覆盖率反超。提出锐化税度量。

04:00
arXiv cs.AI

注意力-残差 Transformer 中路由熵作为不确定性信号的审计

审计显示,路由熵对正确性的增益依赖控制,未超越置信度,且估计器恢复不全,不能否定条件路由信息。

04:00
arXiv cs.AI

MCRI:分析与评估智能体技能的四维框架

提出MCRI四维框架及MCRI-Eval评估法,基于6万余技能验证,可有效预测技能价值并优化下游选择。

04:00
arXiv cs.AI

迈向可靠的自动驾驶视觉语言模型

评估五种视觉语言模型在驾驶问答中面对视觉退化的可靠性,退化影响因模型和场景而异,增强方法效果不一致。

04:00
arXiv cs.AI

决策泰坦:面向离线强化学习长期记忆的测试时训练

提出决策泰坦,用测试时训练层增强决策Transformer,实现比上下文窗口长20倍的长期记忆。

04:00
arXiv cs.AI

非黑非白:用图信息语义ID平衡语义与协同信号(GrIS)

把语义ID构建视为图上的递归聚类,提出GrIS统一框架,兼顾语义与协同信号,Hit@10最高提升52%。

04:00
arXiv cs.AI

AI评估沙盒配置器:支持AI监管沙盒中技术评估的框架

开源框架AI评估沙盒配置器,整合测试目录与统一数据模型,满足AI法案11项要求,已试点并生成报告。

2026年10月1日
04:00
arXiv cs.AI

通过门控与衰减的同策略蒸馏提升OCR忠实性

视觉语言模型改写异常文本会损害OCR忠实性;GAD-RL按学生表现门控并衰减教师蒸馏,提升转录保真度。

04:00
arXiv cs.AI

AI 智能体易受激进化影响

模拟两个大模型对话发现,AI智能体能被同伴激进化,强化既有信念的共鸣效应强于劝说,并波及相关信念。

04:00
arXiv cs.AI

CARAT:材料大语言模型是在推理还是在背诵?

CARAT以八种匹配视图检验材料LLM:增益多因基线缺信息,模型常引用却不使用关系,经监督可学会。

04:00
arXiv cs.AI

NAQD-Env:语言智能体的选择性撤回基准

NAQD-Env评测语言智能体选择性撤回:三模型召回率≤0.06,无有效恢复,仅1例符合参考策略。

04:00
arXiv cs.AI

基于上下文选择与目标加权的扩散语言模型微调

GoldiMask以子模最大化选上下文并加权目标,提升扩散语言模型微调,在推理和代码生成上更优。

04:00
arXiv cs.AI

PrivMeSA:面向医学的隐私感知自演化多智能体系统,基于本地—远程大语言模型协作

本地智能体以强化学习平衡准确率与隐私风险,用经验记忆复用远程知识,披露率由98%降至0.2%。

04:00
arXiv cs.AI

VAmoS Part Deux:更难、更真实的语音智能体仿真

VAmoS Energy基准含100通多请求语音客服电话,测试14种语音栈,完成率17.3%–44.7%,背景电视干扰降至8.6%。

04:00
arXiv cs.AI

走向“模型即库”:面向低资源非洲语言的离线社区共建AI

提出MaaL:将社区录入的小型语音模型作为端侧依赖,实现离线、防幻觉的数据收集,服务低资源非洲语言。

04:00
arXiv cs.AI

临床试验中人类—AI交互的定义与分类:一种多维人类—AI分类方法

提出多维框架分类临床试验人机交互,涵盖AI任务、人机关系、交互配置与人群;LLM辅助分类需人类判断。

04:00
arXiv cs.AI

当科学矛盾在转译中迷失

语言模型在科学文本中判断矛盾时会偏向生物预期而非最佳约束,显示可靠验证还取决于如何选择可比发现。

04:00
arXiv cs.AI

面向自演化程序的组件感知反馈

提出组件感知反馈,将改动组件与指标差异记入归因记忆,提升LLM演化搜索效率,重排序质量更优且省11%词元。

04:00
arXiv cs.AI

ChartRevise:基于代码实现精确图表编辑的数据集与评估协议

推出ChartRevise数据集与评估协议,用代码实现精确图表编辑,含9万余条记录,微调使精确编辑率相对提升22%。

04:00
arXiv cs.AI

GATE-ST:面向空间转录组学的基因感知文本-图像编码器

GATE-ST将基因文本描述编码后与图像嵌入跨注意力融合,提升空间基因表达预测,降低成本。

04:00
arXiv cs.AI

EvoSteer:基于参考锚定信用分配的在线自演化图编排

提出在线自演化图编排范式EvoSteer,以参考锚定信用分配实现技能验证式准入,在12个数据集上显著超越基线。

04:00
arXiv cs.AI

自进化算法设计智能体:通过种群策展策略优化逃离上下文内进化停滞

提出PCPO,让智能体从自生成算法中高效自进化,突破上下文进化停滞,8B模型媲美GPT-5.5。

04:00
arXiv cs.AI

概念锚定的注意力:图注入注意力、时序版本化与认知状态的受控评估

时序版本与认知状态显式化可显著提升准确率;图注入注意力增益主要源于容量增加,机制诊断需禁用对照。

04:00
arXiv cs.AI

科学搜索智能体何处失败:对目标曝光与检查尝试的决策检查点审计

决策检查点审计揭示科学搜索智能体的目标曝光与检查失败:关键词搜索准确率24.6%,原始搜索17.8%。

04:00
arXiv cs.AI

UniEvo-VL:一种多模态模型自我改进的同策略自蒸馏训练方案

UniEvo-VL以自评反馈为特权信息,让同一多模态模型分饰师生做同策略自蒸馏,提升图像生成。

04:00
arXiv cs.AI

从代码到控制:合成参数化反应式控制器

LLM合成控制器结构、搜索调参,决策时无需LLM或规划,实时性强,媲美深度强化学习且交互更少。

04:00
arXiv cs.AI

测试时数学推理中的预算边界效应

轨迹回放显示:上限落在推导中途时,宽松放行可减少弃答并提升准确率,但比较须兼顾实际成本与选择器。

04:00
arXiv cs.AI

保持专注:检验长时程智能体可靠性的根基

提出Long-Transduction诊断:7个开源模型在上下文延长、格式变化、复杂度提升下性能分别降62.8%、36.5%、39.9%。

04:00
arXiv cs.AI

通过多步嵌入检索在视觉空间中学习路由

提出VHOP基准与VHOP-Router,将嵌入模型训为多步检索器,在视觉隐空间直接检索图像链,检索性能从<5%升至76.3%。

04:00
arXiv cs.AI

PathAnchor:面向科学智能体的路径结构化证据

PathAnchor以路径结构化证据工作区组织科学检索,保留角色与方向,在固定预算下显著提升来源召回与引用完整性。

04:00
arXiv cs.AI

面向 GUI 智能体的动作条件双模拟记忆

以动作条件双模拟定义记忆合并:仅当共享动作导致一致结果才合并,免训练,MiniWoB++ 成功率提升。

04:00
arXiv cs.AI

当推理误入歧途:失控推理的注意力动态

大型推理模型扩展推理易退化为冗余验证与循环;RADAR实时识别状态,注意力重对齐可减循环并保性能。

04:00
arXiv cs.AI

积极评分,隐忧暗藏:AI中介组织倾听中的员工声音披露

AI访谈中员工常先给好评、后吐实质顾虑,以缓和、推责等策略自我保护,形成"有界披露"——沉默藏于表达之中。

04:00
arXiv cs.AI

AI语音代理中的人格设定与说服性框架:一项针对儿童的2×2实地实验

德国圣诞热线实地实验:说服性框架使儿童亲社会愿望比例从11.6%升至45.7%,人格权威几乎无效,说话方式比自称身份更关键。

04:00
arXiv cs.AI

更多选择,更少决策:类JEV直接决策模型中的有序尺度偏差

直接决策模型存在序数尺度利用偏差,候选空间压缩,仅用约七成有效支持,BA-LoRA后训练可缓解。

04:00
arXiv cs.AI

多路径LLM推理中的分集合并

多路径LLM推理可建模为分集合并;路径相关性限制投票增益,提示模板多样性降相关,自适应K近MV@32精度。

04:00
arXiv cs.AI

学习遗忘什么:面向大语言模型表示空间的分布性遗忘

提出非参数分布性遗忘框架Mamushi,用概率分类器排序遗忘样本,改善删除与保留权衡,减少遗忘样本需求。

04:00
arXiv cs.AI

当上下文变化时:理解大语言模型中的更新失败

提出CICM基准研究LLM的过期绑定失败,发现注意力漂移致旧值胜出,无需训练调整注意力可纠正多数错误

04:00
arXiv cs.AI

在测试时使用可复用原语组合任务特定的智能体执行框架

提出可复用原语与STITCH框架,测试时按任务选取组合,成功率最高提升12点,开销仅2.7%。

04:00
arXiv cs.AI

面向忠实大语言模型股票收益预测叙事的推理外化

结合时序SHAP与历史类比,外化推理可提升LLM股票收益预测叙事的证据忠实度与准确性。