5356 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.AI

面向全模态大语言模型的基于局部音视频动态的延迟音频剪枝

A-PACK延迟音频剪枝至查询交互后,用局部音视频动态压缩视频并渐进剪枝音视频token,性能最优,预填充计算降78%,解码吞吐提2.21倍。

04:00
arXiv cs.AI

PROSLEX:面向印度司法系统的专家标注法律条文预测新数据集

提出PROSLEX数据集,含1623份专家标注法律文书及7450条解释,评估多种提示策略,推动可解释法律NLP研究。

04:00
arXiv cs.AI

FitAQA:面向多模态大语言模型的健身动作质量评估基准

FitAQA含2219个视频、5512个问答,定义6维度38种错误,设感知、判断、时间定位三任务,揭示现有多模态大模型评估能力不足,视觉感知是关键瓶颈。

04:00
arXiv cs.AI

首届教学怪兽挑战赛结果:AI智能体教学内容知识的基准

教学怪兽挑战赛基准揭示:AI视频教学内容强、适配学习者弱,自动评分对顶尖排序失真,需双改进。

04:00
arXiv cs.AI

从量表到对话:用小型语言模型低负担获取每日经前症状评级

小模型用3个症状簇问题替代6项量表,kappa达0.913,问题减半。

04:00
arXiv cs.AI

全带宽Transformer

提出全带宽Transformer,用潜在反馈加宽解码垂直通道,提升语言、数学与代码性能,解码开销小,逼近1.5倍token训练效果。

04:00
arXiv cs.AI

上下文并非权威:金融市场代理的结构化运行时治理

SAGE-Fin将提议效果置于运行时控制,要求精确工件收据并重查授权;616例测试达协议一致,现场反馈积极。

04:00
arXiv cs.AI

主观任务中的LLM推理:失败模式、缓解与动态推理路由

推理损害主观验证,标准RLVR致“推理崩溃”;条件长度惩罚可恢复,推理人格影响显著,需动态路由。

04:00
arXiv cs.AI

解码表型:融合基因组语言模型与神经影像的框架

提出基因语言模型与神经影像融合框架,利用基因调控和不确定性融合,提升认知衰退和痴呆诊断准确率。

04:00
arXiv cs.AI

用于三维重力反演的深度感知隐式神经表示先验

提出无监督深度感知隐式神经表示进行三维重力反演,无需标签,在合成与野外实验中优于基线,缓解深度模糊。

04:00
arXiv cs.AI

并非无障碍:Android辅助功能如何使移动AI代理遭受间接提示注入

移动AI代理依赖无障碍元数据易受间接提示注入攻击,可致目标劫持、上下文漂移及未授权操作,需零信任输入验证。

04:00
arXiv cs.AI

CoRe-UIE:重新思考水下图像增强中的共存与区域退化

提出CoRe-UIE框架,用共享专家和路由专家分别处理色彩、散射、纹理和光照退化,结合HSIC约束,实现区域自适应增强。

04:00
arXiv cs.AI

谁在架起安全之桥?识别与定位跨语言共享安全通路

识别跨语言共享安全通路,证实其桥接高资源至低资源语言安全迁移,微调少量参数即可提升低资源语言安全性。

04:00
arXiv cs.AI

DualCert:一种基于约束耦合学习的旅行商问题求解器

提出约束耦合学习并结合确定性验证求解TSP;在TSP1000上平均差距0.0573%,比NeuroLKH低67.1%。

04:00
arXiv cs.AI

不同反馈,不同更新:大语言模型用户交互的选择性自学习

将用户反馈分解为修复、规格、空组件,用双LoRA适配器分别泛化修复与规格,实现选择性自学习更新。

04:00
arXiv cs.AI

MELLON:面向在线导航的多模态增强大语言模型

提出MELLON等三种多模态增强方法,在WebShop基准上提升导航任务完成准确率,仅训练一个周期即提升9.26%。

04:00
arXiv cs.AI

RAVEN-Eval:基于LMM偏好判断的规则引导式AI视频生成模型自动评估

提出RAVEN-Eval,以LMM为评委,按规则对视频成对比较,自动评估模型,降低人工成本。

04:00
arXiv cs.AI

CIDER:面向隐私偏好对齐的上下文披露边界数据集

引入含14,850条人工标注的CIDER数据集,测试12种模型预测隐私披露决策,发现个性化可提升准确率但易致误差失衡。

04:00
arXiv cs.AI

签名引导的密集专家合并容量占用

提出SigMerge,用冲突签名设定层容量、基合并赤字分配域份额,按序占用提升15%并排名最佳。

04:00
arXiv cs.AI

CRUISE:视觉-语言模型引导的不确定性感知跨模态传感器融合,实现稳健自动驾驶

提出CRUISE框架,用视觉-语言模型生成细粒度像素级不确定性,引导跨模态融合,并动态建模传感器依赖,提升复杂场景下自动驾驶鲁棒性。

04:00
arXiv cs.AI

面向组件级异常诊断的可解释GNN框架

提出可解释GNN框架,将异常检测从传感器级转向组件级,通过分析传感器间影响变化识别并排序故障组件。

04:00
arXiv cs.AI

Omni2LoRA:保持连贯性的参数化记忆,用于高效全模态语言模型

提出Omni2LoRA,用参数记忆压缩多模态上下文,经GRPO优化秩分配保持跨模态连贯;30%预算下精度提升8-12%,TTFT降低12倍。

04:00
arXiv cs.AI

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

提出安全场景推理基准,连接工业事故知识,含十二万问答对,揭示模型安全推理短板。

04:00
arXiv cs.AI

一阶证明搜索中的保结构不确定性传播

利用证明历史重构不确定前提,计算证明可用概率,解析正负支持与例外,无需全局基础化。

04:00
arXiv cs.AI

ASPaeroFlow:面向空中交通流量与容量协同管理的分解启发式方法

提出ASPaeroFlow启发式,联合优化流量与空域配置,兼顾精度与规模,实验表明协同优化优于顺序优化,空域配置影响更大。

04:00
arXiv cs.AI

业务真相,而非SQL准确性:规则门控7B分析智能体优于直接提示的32B基线

新基准表明,规则门控7B智能体的业务真相率远超32B基线,假成功大降且成本更低。

04:00
arXiv cs.AI

技能哨兵:通过运行时保障实现LLM智能体可靠技能执行

SkillSentry框架用DSL与运行时监控,结合历史轨迹迭代优化,使LLM代理技能执行成功率平均提升24.1%,稳定性更高。

04:00
arXiv cs.AI

P$^{3}$:程序与证明联合规划的验证代码生成

提出P$^{3}$,先制定程序与证明联合计划再实现,提升验证代码生成解决率并降成本,引入Lean4Commit0基准。

04:00
arXiv cs.AI

特权似然不等于令牌信用;实验显示令牌评分近乎随机,需分别验证评分含义、反馈构建与训练行为。

特权似然非自动等于令牌信用:AIME 2025测试中令牌评分近随机(AUC=0.505),需分别验证评分含义、反馈构建与训练行为。

04:00
arXiv cs.AI

ComboShoppingBench:评估大语言模型代理在预算约束和优惠券条件下的组合购物篮构建

提出组合购物基准,评估大语言模型智能体在预算和优惠券约束下构建购物篮的能力,显示强智能体仍困难。

04:00
arXiv cs.AI

MMArch:基于建筑学证据的多模态推理基准测试

MMArch评估建筑多模态推理:1212题需整合视觉证据与原理。最强开源30%,专有52%,专家95%,差距大。

04:00
arXiv cs.AI

线性化2-单纯形注意力

将三重线性得分改写为内积,用正随机特征近似,实现线性成本与全局可达,超越KDA混合模型。

04:00
arXiv cs.AI

CADEngBench:看起来像CAD,但真能用吗?评估参数化设计、装配推理与物理仿真

提出双轨基准CADEngBench,测试参数化设计与装配;发现编辑比生成易,复杂编辑和FEA难,装配定位准但接合恢复差。

04:00
arXiv cs.AI

基于熵的代码对抗翻译用于真实仓库迁移

提出ECAT多智能体框架经生成器判别器对抗熵最小化实现安卓到鸿蒙仓库迁移真实基准达74.7%质量

04:00
arXiv cs.AI

CoRE: 基于均衡的共识奖励用于测试时强化学习

以均衡共识奖励取代多数投票,将采样视为图,获得分级奖励与伪标签,提升测试时强化学习,省54-70%步数。

04:00
arXiv cs.AI

从提示到框架:从零构建Coderlet

模型不单独决定代理行为,框架通过模型、执行、状态三边界将生成转为动作、反馈代入决策、状态跨请求延续。

04:00
arXiv cs.AI

GeoPhysAdapter:基于视觉基础模型的尺度匹配地球物理自适应跨域滑坡制图

提出地理物理适配器,在像素与候选体双尺度有界自适应,跨域误报显著减少,交并比提升14.2%。

04:00
arXiv cs.AI

LLM引导的基于仿真轨迹的启发式设计:动态生产与AGV调度案例研究

基于仿真轨迹诊断,大语言模型并行修改策略,重复评估择优,在动态生产与AGV调度中胜过多种基线。

04:00
arXiv cs.AI

CircuitReason-1k:电路长程视觉到符号推理的基准测试

提出含1000个教科书问题的基准,评估多模态模型长程视觉到符号推理;最佳模型准确率84.8%,但长程问题性能下降。

04:00
arXiv cs.AI

耦合图-策略蒸馏用于多病共存老年人个性化用药安全

提出一种耦合图-策略蒸馏框架,保障多病共存老年人用药安全,性能超强基线,无危险建议。

04:00
arXiv cs.AI

用于主动推断的重整化生成模型:基础、推导与验证

针对主动推断离散模型扩展难题,提供重整化生成模型的自洽推导与开源验证,阐明层级更新机制,提升可复现性。

04:00
arXiv cs.AI

每模型一对适配器:语言模型的通用激活接口

提出通用激活总线,通过每模型轻量适配器映射到共享空间,使探针、SAE等工具跨模型复用且无需重训。

04:00
arXiv cs.AI

CoRCi: 跨域序列推荐中一致性兴趣建模的交叉重建

CoRCi通过交叉重建生成混合域表示,采用单一域无关损失与FocalNCE抑制域差异,在四个数据集上超越最新方法。

04:00
arXiv cs.AI

VERDI:检索并非迁移——持续世界模型优化

VERDI用优化指纹检索验证经验,持续优化世界模型,搜索降68%、GPU降69%,负迁移至0.06。

04:00
arXiv cs.AI

反思自进化智能体:我们还需要规定优化流水线吗?

提出开放式优化,让优化器自组改进流程;十四项对比中十二胜一平一负,优于预设流水线,且耗更少预算。

04:00
arXiv cs.AI

失配至关重要:超越词元一致性的在线策略蒸馏

揭示在线策略蒸馏的退化一致性问题,提出TIDE,区分过剩与缺失词元,分别抑制与注入,显著提升数学推理。

04:00
arXiv cs.AI

智能体自动研究即模糊测试

自主研究需像模糊测试一样利用密集反馈指导搜索,而非仅生成排序,并保护最终验证。

04:00
arXiv cs.AI

迈向实时视频问诊的专家级医疗AI

首个专家级视频问诊AI(AMIE)在病史采集、诊断等达医生水平,患者更偏好其沟通,但精细解剖等仍有限。

04:00
arXiv cs.AI

ArchAgent v2:数据预取锦标赛案例研究

ArchAgent v2用级联进化与硬件反馈自动设计三级预取器,DPC4中超越人工冠军,IPC提高3.8%,低带宽单核提高4.6%,多核仍挑战。

04:00
arXiv cs.AI

CEAA:面向交互计算系统的认知具身智能体架构

提出模块化认知架构,融合感知思考行动与信念愿望意图模型,连接推理与实时执行,支持可扩展自适应可解释智能体。