6000 条条目 · 106 个活跃源
2026年6月11日
04:00
ArXiv AI

TileFuse:面向AMD NPU的高效量化LLM推理融合混合精度内核库

TileFuse在AMD XDNA2 NPU上融合解包、反量化与矩阵运算,实现AWQ量化,性能提升最高281%,能耗降低超64%。

04:00
ArXiv AI

伦理评估代理(EeVA):一种辅助伦理审议的原型类智能体工作流的概念验证测试结果

EeVA基于LLM,通过多框架评估与综合,支持结构化伦理反思而非给出绝对答案,概念验证有效。

04:00
ArXiv AI

RAIL:基于CHC认知框架重新思考大型音频语言模型中的听觉智能

基于CHC认知框架,RAIL将听觉认知分解为五种核心能力,评估26个模型发现性能不均,建立认知评估新范式。

04:00
ArXiv AI

Artificial Intelligence in Ship Finance: Applications, Opportunities, and a Case Study in AI-Augmented Loan Origination

04:00
ArXiv AI

ConsistencyPlanner: 基于快速采样一致性模型的实时规划

提出ConsistencyPlanner,利用快速采样一致性模型实现实时多模态规划,通过高效采样与特征融合提升安全性能。

04:00
ArXiv AI

Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

04:00
ArXiv AI

MPC-Patch-Bench:面向安全的多方计算LLM代码补丁

提出MPC-Patch-Bench基准,评估LLM修复MPC代码,含数据整理与安全验证,LLM通过率最高22.9%降至17.1%。

04:00
ArXiv AI

JailbreakOPT:工具辅助的迭代式越狱提示优化

JailbreakOPT框架利用工具库与上下文汤普森采样优化越狱提示,显著提升成功率并减少攻击次数。

04:00
ArXiv AI

迈向文献目录与形式化数学知识之间的桥接层

提出桥接数据库对齐文献与形式化证明,引入形式化得分,实现大规模覆盖率分析,迈向集成知识图谱。

04:00
ArXiv AI

主权保证边界:面向代理基础设施的证书绑定准入

提出主权保证边界,通过证书绑定和证据摘要实现自主代理的安全准入与可验证执行。

04:00
ArXiv AI

大语言模型在道德推理上是否表现不佳?

重新评估MoReBench数据集发现,LLMs生成评分标准的能力优于直接回答,表明其道德推理能力被低估。

04:00
ArXiv AI

LUCID:从非结构化人类视频中学习与具身无关的意图模型,以实现可扩展的灵巧机器人技能获取

LUCID利用互联网人类视频学习任务意图,结合仿真控制,实现跨具身灵巧技能获取及零样本新场景泛化。

04:00
ArXiv AI

Lung-SRAD:基于光谱感知正则化音频DASS与双轴补丁混合对比学习的呼吸音分类

提出基于状态空间模型的呼吸音分类方法,通过光谱正则化和双轴对比学习,性能提升5%。

04:00
ArXiv AI

Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production

04:00
ArXiv AI

质量自适应角度边界学习用于呼吸音分类

提出QLung框架,利用频谱熵自适应调整角度边界,提升呼吸音分类泛化性能。

04:00
ArXiv AI

DuoBench:一个可复现的模拟与真实世界双手操控基准

提出DuoBench双手操控基准,含11任务,评估显示当前策略在协调、早期阶段和虚实迁移中仍存挑战。

04:00
ArXiv AI

基于GPU的LLM服务系统中的软件老化特征分析

实证揭示GPU基LLM服务系统普遍存在内存老化,泄漏率取决于运行时和部署配置。

04:00
ArXiv AI

个体行为的隐式神经表示

提出Behavioral INR模型,无监督学习策略表示,处理变长序列和分布外偏移,提升策略识别能力。

04:00
ArXiv AI

用于异步视频面试中人格与认知能力评估的冻结多模态嵌入

基于冻结多模态编码器,人格回归MSE达0.2696,认知分类发现数据集捷径。

04:00
ArXiv AI

不稳定特征与可复现子空间:理解稀疏自编码器中的种子依赖性

稳定特征承载关键信号,不稳定特征集中于可复现子空间,种子依赖性反映基歧义而非噪声。

04:00
ArXiv AI

弥合形态差距:通过意图条件微调将VLA模型适配到灵巧操作

提出InDex框架,通过意图代理两阶段学习,弥合形态差距,数据高效实现灵巧操作。

04:00
ArXiv AI

nD-RoPE:一种面向n维位置嵌入的广义RoPE

提出nD-RoPE,通过各向同性谱条件与多尺度正则单纯形波矢量设计,提升高维位置嵌入性能。

04:00
ArXiv AI

OpenMedReason:面向医学视觉语言模型的科学推理监督

OpenMedReason含45万医学推理实例,提升VQA准确率20%,同时改善感知、知识与推理。

04:00
ArXiv AI

混合系统属性的运行时强制执行

提出基于混合自动机的运行时强制执行框架,通过事件编辑与连续监控实时保障安全,计算开销小。

04:00
ArXiv AI

Exploration Structure in LLM Agents for Multi-File Change Localization

04:00
ArXiv AI

论LLM作为科学新颖性评估法官的局限性

LLM评估研究问题新颖性时产生幻象,与人类专家结论相悖,其可靠性受质疑。

04:00
ArXiv AI

SpikeDecoder:用脉冲神经网络实现GPT架构

提出SpikeDecoder,基于SNN的Transformer解码器用于NLP,理论能耗降低87%-93%。

04:00
ArXiv AI

AI IDE中的规则分类与演化:一项挖掘与调查研究

挖掘83个项目,分类7310条规则,发现开发者对架构约束的重视与实际规则配置不一致,规则更新可提升软件制品合规率22.99%。

04:00
ArXiv AI

具身基准构建的智能自动化:流程、具身、模拟器与趋势

综述指出自动化将成本转向验证与治理,强调可诊断、可审计、可更新的流程。

04:00
ArXiv AI

AI的市场设计:超越版权二元论

现有版权二元论失败,导致创作者补偿不足与创新抑制;新设计通过数据中介内化外部性并补贴创新,恢复效率。

04:00
ArXiv AI

基于优化引导算子的遗传算法的数学视角

提出遗传算法通用模型,将优化表述为查询复杂度问题,获得捕捉多样性作用的紧算法。

04:00
ArXiv AI

环境扩散策略:从次优数据中学习机器人模仿

提出基于噪声依赖数据使用的模仿学习方法,从次优数据提取有用特征,在六项任务中优于基线,最高提升33%。

04:00
ArXiv AI

面向机器人生理感知的光照鲁棒摄像头心率估计

提出光照鲁棒rPPG框架,在变化光照下心率估计MAE仅0.79bpm,相关系数0.982,较基线提升93.6%

04:00
ArXiv AI

MLaGA:多模态大语言与图助手

提出MLaGA模型,将大语言模型扩展到多模态图推理,通过结构感知编码器和指令微调,在多种图学习任务中取得领先性能。

04:00
ArXiv AI

中文标题:观点:停止将中间令牌拟人化为推理/思维痕迹!

中文摘要:拟人化中间令牌为推理/思维痕迹有害无益,易混淆模型本质并导致错误研究。

04:00
ArXiv AI

利用多模态AI代理进行可持续性评估

多模态AI代理系统自动估算电子设备碳足迹,从公共数据获取信息,耗时不足一分钟,误差仅19%。

04:00
ArXiv AI

时间序列中大语言模型的推理与智能体系统综述

本文综述时间序列推理的三种拓扑(直接、链式、分支),强调平衡能力与成本,未来需发展实用基准和闭环测试。

04:00
ArXiv AI

合成住宅:数据稀缺下住宅建筑数据生成的多模态生成式AI流水线

提出多模态生成式AI框架,利用公开数据生成合成住宅数据集,减少数据稀缺依赖,实现95%以上数据真实性。

04:00
ArXiv AI

FACTR 2: 商用机器臂的外部力传感学习提升策略学习

提出无需力传感器的NEXT力矩估计法(仅需10分钟数据即可高精度估计)与FIRST重采样训练法,使策略学习任务进度提升超17%。

2026年6月10日
04:00
ArXiv AI

使用合成推理数据进行监督微调损害现实疾病预测

实验发现,合成推理数据微调会降低疾病预测性能,症结在于叙事合理性与判别优化存在结构性冲突。

04:00
ArXiv AI

从感知到决策:多模态大语言模型中听觉与视觉感知的信息流

研究揭示AVLLMs中音视频信息流路径随输入配置变化,丢弃部分令牌可提升效率,为多模态可解释性与优化奠定基础。

04:00
ArXiv AI

Predictive Assistance and the Temporal Dynamics of Exploratory Compression

04:00
ArXiv AI

AI辅助优化下的探索响应性与适应性刚性

AI辅助下,探索响应性被替代导致局部高效但全局刚性,或增强探索,效果取决于制度与人机交互。

04:00
ArXiv AI

上下文越少,智能体越优:面向长周期工具使用LLM代理的高效上下文工程

剪枝至最近5次工具调用并自动摘要,完成率达91.6%,相比完整上下文更高效可靠,大幅降低token与耗时。

04:00
ArXiv AI

使用LoRA和NEFTune对DeepSeek-R1-8B模型进行指令微调

结合LoRA和NEFTune微调DeepSeek-R1-8B,金融NER微F1达0.912,超越多个基线模型。

04:00
ArXiv AI

从上下文感知到冲突感知:泛化对比解码以应对大语言模型知识冲突

提出冲突感知对比解码,动态权衡上下文与先验知识,解决固有不对称性,在三种冲突状态下提升EM达16-33%。

04:00
ArXiv AI

空间记忆必须存储什么:以遮挡作为语言智能体记忆的测试

空间记忆需几何引导召回,遮挡感知依赖射线追踪,验证其必要性。

04:00
ArXiv AI

ReflectiChain:基于LLM驱动世界模型的认知接地实现供应链韧性

提出ReflectiChain框架,通过双环学习分离认知不确定性,提升供应链合理性一致性33%并具反脆弱性。

04:00
ArXiv AI

推理还是记忆?大语言模型强化学习中的方向感知多样性探索

提出DiRL方向感知强化学习框架,区分推理与记忆驱动的多样性,集成GRPO,显著提升数学推理能力。

04:00
ArXiv AI

基于信念空间的主动推理个性化癌症治疗控制

主动推理结合临床数据,在测量预算约束下实现患者分类与高效治疗。