5898 条条目 · 106 个活跃源
2026年8月13日
04:00
ArXiv AI

RecSys工厂:将LLM智能体自主性约束于工业推荐生命周期决策点

将LLM自主性约束于决策点,化解自主-确定性-效率三难,腾讯78天三业务线部署,调度成功率78.6%。

04:00
ArXiv AI

迈向具身智能体的操控框架

提出一种具身智能体框架,用场景图与退出码评价连接物理世界,令其借工具组合完成长程任务。

04:00
ArXiv AI

当自洽性适得其反:多数投票损害小型LLM在多数硬科学问题上的表现

多数投票在硬科学问题上降低小型LLM准确率,因置信度不反映正确性,预注册实验证实。

04:00
ArXiv AI

前沿大语言模型能否匹敌原生多模态嵌入?——基于困难负样本图文检索的比较

首个直接比较显示,LLM排名与多模态嵌入相当,嵌入更适低延迟。

04:00
ArXiv AI

概览、审视与思考:推进视频异常检测从免训练到智能体推理

针对视频异常检测的“何时-何因”割裂,提出免训练GtS与工具增强智能体方法,构建了VAGU-T基准和联合评估指标,兼顾精度与速度。

04:00
ArXiv AI

部署决策可靠性:用于长周期智能体评估规模设计的概化理论框架

智能体主效应<3%,交互效应占7-23%,排行榜反映专长而非能力,需用概化理论框架评估部署可靠性。

04:00
ArXiv AI

从数字到判断:面向欧洲上市房地产的专家LLM智能体与强化学习

拆分提示提升数值任务15.8%,强化学习提升判断任务14.2%,均有效迁移至未见数据。

04:00
ArXiv AI

中文标题:用于内容推荐的逆向心智理论建模:从网页浏览到动态智能界面

中文摘要:提出逆向心智理论IToM流水线,从行为反推信念人格,多假设溯因优于真值,跨模态验证。

04:00
ArXiv AI

定位安全对齐:MLP层与网络中段编码大语言模型的拒绝行为

拒绝行为主要编码于MLP权重及中层区块,且成分组合非加性,呈局部化与交互敏感性。

04:00
ArXiv AI

CoAdapt-GUI:面向未知GUI应用的联合工作流上下文与策略自适应

CoAdapt-GUI通过测试时自适应,联合调整工作流上下文与策略,在未见应用中达45.0%准确率,较基线提升7.5个百分点。

04:00
ArXiv AI

MBA:面向真实世界商业构思的多模态基准与智能体

首个商业构思多模态基准,六领域三万样本,所训智能体在创意与可行性等指标大幅超越基线。

04:00
ArXiv AI

从在线用户反馈中学习购物智能体

提出LOFA框架,利用真实在线交互日志,结合强化学习与反馈感知蒸馏,提升购物智能体推荐质量与用户满意度。

04:00
ArXiv AI

预见而不视:世界动作模型的潜在未来

提出ForeWAM,利用Future-KV复用键值状态,使直接策略模型无需生成未来视频即可为动作生成提供预测上下文,在LIBERO上成功率超96%。

04:00
ArXiv AI

CLAIM:基于不确定性度量的大语言模型开放域主动澄清

提出一个基于不确定性度量的主动澄清框架,用多模型答案分歧熵生成训练数据,免人工标注并提升开放域交互。

04:00
ArXiv AI

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

提出智能体双子框架,融合大语言模型与数字孪生异常检测,经智能体协作提升诊断、检索与缓解质量。

04:00
ArXiv AI

XBridge:异构大语言模型通信的实体锚定潜空间桥梁

XBRIDGE:实体锚定的异构LLM潜空间通信,用词汇锚与潜增强,超越文本通信,延迟降11倍。

04:00
ArXiv AI

HUGIN:增强自主物流分拣的视觉语言规划

提出一种增强视觉语言规划的训练框架,结合数据增强与全局上下文排名,使自主物流分拣准确率升至78.8%。

04:00
ArXiv AI

基于贝叶斯更新的概率分布比例类比

提出基于贝叶斯更新的概率分布比例类比框架,适用于指数族,并通过高斯混合近似推广至任意分布。

04:00
ArXiv AI

使大语言模型更客观:利用特质不变安全调优稳定跨特质的安全行为

提出特质不变安全调优,稳定大模型跨特质安全行为,增强拒答有害请求,保持通用能力。

04:00
ArXiv AI

图结构评分标准:将评分标准编译为类型化评估图以用于LLM评判

提出图结构评分标准(GSR),编译为类型化评估图,分别评估后聚合,提升LLM评判准确率。

04:00
ArXiv AI

ExRole:从团队轨迹到多智能体语言模型中的可执行角色

ExRole将团队轨迹转化为可执行角色:学习未来感知原型,生成指令与标记,在多跳问答上显著超越基线。

04:00
ArXiv AI

策略即逻辑:对规则进行稳健推理

策略即逻辑:语言模型抽事实+答案集求解器推理,较提示/编码法更准、省10倍token,稳健可审计。

04:00
ArXiv AI

重试、切换还是放弃?通过受控错误注入学习策略感知的工具使用策略

通过受控错误注入,结合工具记忆与强化学习,提升LLM智能体在工具失败时的恢复能力,保持正常性能。

04:00
ArXiv AI

用于遗留HPC现代化的智能体工作流:转换GAMESS双电子积分核心

提出智能体工作流,将GAMESS双电子积分从F77转F2008,612次测试位级一致、零化学差异。

04:00
ArXiv AI

基于检索增强大语言模型构建复杂系统诊断的动态主逻辑模型知识图谱

利用RAG与LLM自动从技术文档构建动态主逻辑知识图谱,验证于沸水堆低压冷却系统,支持诊断与可靠性分析。

04:00
ArXiv AI

基于强化学习的DBMS缓冲池自动调优以实现最优内存利用

提出在线强化学习系统MicroTune,动态调整缓冲池大小,减少内存浪费并满足SLA,实验显示能显著节省内存且减少违规。

04:00
ArXiv AI

每个汇总规则都有其适用场景:将概率组合规则匹配到情境与代价

组合概率的公式取决于数值含义与证据关系;平均、赔率乘法各有前提,误用会影响决策与概率评估。

04:00
ArXiv AI

物理信息隐式神经表示用于改进心肌灌注MRI定量

将物理信息神经网络与时空隐式表示结合,提升心肌灌注MRI定量的准确性、平滑性和物理一致性。

04:00
ArXiv AI

LLM智能体中的后门净化动态

防御性投毒配合反学习可清除多数原后门,共驻后门有协同清除效应,但中间层仍残留触发痕迹。

04:00
ArXiv AI

化学意义的文本化赋能大语言模型对金属有机框架的可解释验证

将金属有机框架晶体信息转为化学文本,微调大语言模型可验证不合理结构并给出诊断,媲美图模型。

04:00
ArXiv AI

加强完全正当代表:高效验证与计算

提出FJR+公理,可在多项式时间内验证与满足,RBG算法可构造满足FJR+的委员会,并扩展至参与式预算。

04:00
ArXiv AI

大型语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争

研究发现LLM在言语冲突任务中表现出一致性效应,源自权重内默认映射与上下文规则映射的竞争。

04:00
ArXiv AI

G0.5:单一自回归流实现机器人推理与行动

G0.5是统一自回归VLA模型,用单一Transformer解码器同时生成推理与动作,跨本体动作分词器及视觉记忆模块支撑,七项基准超越SOTA。

04:00
ArXiv AI

通过坍缩生成对文生图扩散模型进行指纹识别

提出利用坍缩生成现象为文生图扩散模型做非侵入式指纹认证,可抗微调和混淆,验证所有权。

04:00
ArXiv AI

指令对齐用于二进制代码表示学习

提出以指令对齐为辅助训练目标,提升二进制代码表示的检索准确率与判别力。

04:00
ArXiv AI

APEX:面向内存高效边缘MoE推理的自适应专家预取

APEX自适应专家预取:预测加载并重叠,延迟降26%、EDP降41%,正确/无停顿双模式,提升边缘MoE推理。

04:00
ArXiv AI

面向基于模型的运行时网络安全:关于控制流异常检测、攻击识别与硬件监控

提出软硬件结合监控的模型方法,提升控制流异常检测与攻击识别精度

04:00
ArXiv AI

双量子比特激发门的12-CNOT电路实现

首次实现双量子比特激发门12-CNOT分解,优于现有13-CNOT方案,拥有最低CNOT数、深度及总深度。

04:00
ArXiv AI

基于光谱的两阶段可变形卷积纳米光子吸收体逆向设计

提出两阶段可变形卷积框架,从吸收光谱重建纳米光子谐振器结构,结合监督与对抗精修,显著优于普通卷积。

04:00
ArXiv AI

面向高效QoS感知自动缩放的用户辅助协作式分布式推理

提出用户辅助协作分布式推理,结合专用与用户资源,分布式调度随用户增长更优,降低延迟并减少专用资源消耗

04:00
ArXiv AI

HCGRec:基于提示条件的语义ID生成式推荐

提出HCGRec,为困难样本提供最小目标前缀提示,将零奖励组转为有效比较,零优势样本从70%降至20%以下。

2026年8月12日
04:00
ArXiv AI

UniMoMo:基于专家合并的MoE加速方法,用于大型推荐模型

提出UniMoMo后训练压缩框架,按功能相似性合并专家并保护高流量专家,保持NDCG性能,获得1.28-1.63倍加速。

04:00
ArXiv AI

MedCalc-R1:面向医学数学推理的知识引导奖励框架

提出知识引导混合奖励框架,以公式验证与软硬约束提升医学数学推理准确性与泛化性。

04:00
ArXiv AI

结构动力学图世界模型:统一建模、约束推演与可解释校准

提出SD-GWM结构动力学图世界模型,统一机制与残差,约束保真且可审计,极端事件下性能显著。

04:00
ArXiv AI

SymDiag:通过神经符号验证实现大语言模型推理的可解释诊断

提出SymDiag框架,将推理验证转为结构化失败诊断,定位错误步骤并区分翻译/推理错误,提升不可信推理检测与修复效果。

04:00
ArXiv AI

AI评估应衡量验证成本,而非仅正确性

提出验证成本错误概念,主张AI评估应衡量验证成本,因高准确率可能掩盖实际验证困难。

04:00
ArXiv AI

提升多模态RLVR的泛化鲁棒性

提出PIRL,用动态三元奖励和一致性正则化,解决RLVR对提示变化脆弱,提升泛化鲁棒性。

04:00
ArXiv AI

集成多模态AI系统:检索增强推理、物体感知与损伤分析

多模态损伤评估系统,融合检索增强、热成像、视觉与无线感知,提升准确性与鲁棒性。

04:00
ArXiv AI

从手册到维护:在低资源环境下微调MedGemma以支持多模态成像系统

面向低资源地区,微调MedGemma模型提升影像设备维修问答准确率,F1等指标显著提高。

04:00
ArXiv AI

阅读不等于推理:弥合视觉-文本压缩中的智能体策略差距

提出跨模态策略自蒸馏框架CAPS,弥补视觉文本压缩中的智能体策略差距,提升性能并大幅降低上下文成本。