TileFuse:面向AMD NPU的高效量化LLM推理融合混合精度内核库
TileFuse在AMD XDNA2 NPU上融合解包、反量化与矩阵运算,实现AWQ量化,性能提升最高281%,能耗降低超64%。
伦理评估代理(EeVA):一种辅助伦理审议的原型类智能体工作流的概念验证测试结果
EeVA基于LLM,通过多框架评估与综合,支持结构化伦理反思而非给出绝对答案,概念验证有效。
RAIL:基于CHC认知框架重新思考大型音频语言模型中的听觉智能
基于CHC认知框架,RAIL将听觉认知分解为五种核心能力,评估26个模型发现性能不均,建立认知评估新范式。
Artificial Intelligence in Ship Finance: Applications, Opportunities, and a Case Study in AI-Augmented Loan Origination
ConsistencyPlanner: 基于快速采样一致性模型的实时规划
提出ConsistencyPlanner,利用快速采样一致性模型实现实时多模态规划,通过高效采样与特征融合提升安全性能。
Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models
MPC-Patch-Bench:面向安全的多方计算LLM代码补丁
提出MPC-Patch-Bench基准,评估LLM修复MPC代码,含数据整理与安全验证,LLM通过率最高22.9%降至17.1%。
JailbreakOPT:工具辅助的迭代式越狱提示优化
JailbreakOPT框架利用工具库与上下文汤普森采样优化越狱提示,显著提升成功率并减少攻击次数。
迈向文献目录与形式化数学知识之间的桥接层
提出桥接数据库对齐文献与形式化证明,引入形式化得分,实现大规模覆盖率分析,迈向集成知识图谱。
主权保证边界:面向代理基础设施的证书绑定准入
提出主权保证边界,通过证书绑定和证据摘要实现自主代理的安全准入与可验证执行。
大语言模型在道德推理上是否表现不佳?
重新评估MoReBench数据集发现,LLMs生成评分标准的能力优于直接回答,表明其道德推理能力被低估。
LUCID:从非结构化人类视频中学习与具身无关的意图模型,以实现可扩展的灵巧机器人技能获取
LUCID利用互联网人类视频学习任务意图,结合仿真控制,实现跨具身灵巧技能获取及零样本新场景泛化。
Lung-SRAD:基于光谱感知正则化音频DASS与双轴补丁混合对比学习的呼吸音分类
提出基于状态空间模型的呼吸音分类方法,通过光谱正则化和双轴对比学习,性能提升5%。
Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production
质量自适应角度边界学习用于呼吸音分类
提出QLung框架,利用频谱熵自适应调整角度边界,提升呼吸音分类泛化性能。
DuoBench:一个可复现的模拟与真实世界双手操控基准
提出DuoBench双手操控基准,含11任务,评估显示当前策略在协调、早期阶段和虚实迁移中仍存挑战。
基于GPU的LLM服务系统中的软件老化特征分析
实证揭示GPU基LLM服务系统普遍存在内存老化,泄漏率取决于运行时和部署配置。
个体行为的隐式神经表示
提出Behavioral INR模型,无监督学习策略表示,处理变长序列和分布外偏移,提升策略识别能力。
用于异步视频面试中人格与认知能力评估的冻结多模态嵌入
基于冻结多模态编码器,人格回归MSE达0.2696,认知分类发现数据集捷径。
不稳定特征与可复现子空间:理解稀疏自编码器中的种子依赖性
稳定特征承载关键信号,不稳定特征集中于可复现子空间,种子依赖性反映基歧义而非噪声。
弥合形态差距:通过意图条件微调将VLA模型适配到灵巧操作
提出InDex框架,通过意图代理两阶段学习,弥合形态差距,数据高效实现灵巧操作。
nD-RoPE:一种面向n维位置嵌入的广义RoPE
提出nD-RoPE,通过各向同性谱条件与多尺度正则单纯形波矢量设计,提升高维位置嵌入性能。
OpenMedReason:面向医学视觉语言模型的科学推理监督
OpenMedReason含45万医学推理实例,提升VQA准确率20%,同时改善感知、知识与推理。
混合系统属性的运行时强制执行
提出基于混合自动机的运行时强制执行框架,通过事件编辑与连续监控实时保障安全,计算开销小。
Exploration Structure in LLM Agents for Multi-File Change Localization
论LLM作为科学新颖性评估法官的局限性
LLM评估研究问题新颖性时产生幻象,与人类专家结论相悖,其可靠性受质疑。
SpikeDecoder:用脉冲神经网络实现GPT架构
提出SpikeDecoder,基于SNN的Transformer解码器用于NLP,理论能耗降低87%-93%。
AI IDE中的规则分类与演化:一项挖掘与调查研究
挖掘83个项目,分类7310条规则,发现开发者对架构约束的重视与实际规则配置不一致,规则更新可提升软件制品合规率22.99%。
具身基准构建的智能自动化:流程、具身、模拟器与趋势
综述指出自动化将成本转向验证与治理,强调可诊断、可审计、可更新的流程。
AI的市场设计:超越版权二元论
现有版权二元论失败,导致创作者补偿不足与创新抑制;新设计通过数据中介内化外部性并补贴创新,恢复效率。
基于优化引导算子的遗传算法的数学视角
提出遗传算法通用模型,将优化表述为查询复杂度问题,获得捕捉多样性作用的紧算法。
环境扩散策略:从次优数据中学习机器人模仿
提出基于噪声依赖数据使用的模仿学习方法,从次优数据提取有用特征,在六项任务中优于基线,最高提升33%。
面向机器人生理感知的光照鲁棒摄像头心率估计
提出光照鲁棒rPPG框架,在变化光照下心率估计MAE仅0.79bpm,相关系数0.982,较基线提升93.6%
MLaGA:多模态大语言与图助手
提出MLaGA模型,将大语言模型扩展到多模态图推理,通过结构感知编码器和指令微调,在多种图学习任务中取得领先性能。
中文标题:观点:停止将中间令牌拟人化为推理/思维痕迹!
中文摘要:拟人化中间令牌为推理/思维痕迹有害无益,易混淆模型本质并导致错误研究。
利用多模态AI代理进行可持续性评估
多模态AI代理系统自动估算电子设备碳足迹,从公共数据获取信息,耗时不足一分钟,误差仅19%。
时间序列中大语言模型的推理与智能体系统综述
本文综述时间序列推理的三种拓扑(直接、链式、分支),强调平衡能力与成本,未来需发展实用基准和闭环测试。
合成住宅:数据稀缺下住宅建筑数据生成的多模态生成式AI流水线
提出多模态生成式AI框架,利用公开数据生成合成住宅数据集,减少数据稀缺依赖,实现95%以上数据真实性。
FACTR 2: 商用机器臂的外部力传感学习提升策略学习
提出无需力传感器的NEXT力矩估计法(仅需10分钟数据即可高精度估计)与FIRST重采样训练法,使策略学习任务进度提升超17%。
使用合成推理数据进行监督微调损害现实疾病预测
实验发现,合成推理数据微调会降低疾病预测性能,症结在于叙事合理性与判别优化存在结构性冲突。
从感知到决策:多模态大语言模型中听觉与视觉感知的信息流
研究揭示AVLLMs中音视频信息流路径随输入配置变化,丢弃部分令牌可提升效率,为多模态可解释性与优化奠定基础。
Predictive Assistance and the Temporal Dynamics of Exploratory Compression
AI辅助优化下的探索响应性与适应性刚性
AI辅助下,探索响应性被替代导致局部高效但全局刚性,或增强探索,效果取决于制度与人机交互。
上下文越少,智能体越优:面向长周期工具使用LLM代理的高效上下文工程
剪枝至最近5次工具调用并自动摘要,完成率达91.6%,相比完整上下文更高效可靠,大幅降低token与耗时。
使用LoRA和NEFTune对DeepSeek-R1-8B模型进行指令微调
结合LoRA和NEFTune微调DeepSeek-R1-8B,金融NER微F1达0.912,超越多个基线模型。
从上下文感知到冲突感知:泛化对比解码以应对大语言模型知识冲突
提出冲突感知对比解码,动态权衡上下文与先验知识,解决固有不对称性,在三种冲突状态下提升EM达16-33%。
空间记忆必须存储什么:以遮挡作为语言智能体记忆的测试
空间记忆需几何引导召回,遮挡感知依赖射线追踪,验证其必要性。
ReflectiChain:基于LLM驱动世界模型的认知接地实现供应链韧性
提出ReflectiChain框架,通过双环学习分离认知不确定性,提升供应链合理性一致性33%并具反脆弱性。
推理还是记忆?大语言模型强化学习中的方向感知多样性探索
提出DiRL方向感知强化学习框架,区分推理与记忆驱动的多样性,集成GRPO,显著提升数学推理能力。
基于信念空间的主动推理个性化癌症治疗控制
主动推理结合临床数据,在测量预算约束下实现患者分类与高效治疗。