5442 条条目 · 106 个活跃源
2026年6月18日
04:00
arXiv cs.AI

Co-PLNet: 协作点线网络实现提示引导的线框解析

Co-PLNet通过点线协作与空间提示,提升线框解析精度及鲁棒性,兼具实时效率。

04:00
arXiv cs.AI

增强型进化多目标深度强化学习用于可靠高效无线可充电传感器网络

提出融合LSTM与动态帕累托评估的增强型进化多目标深度强化学习算法,有效平衡节点存活率与能量效率。

04:00
arXiv cs.AI

学习注入的形式化推理:从合约合成到工件复用与形式语义

融合AI,通过合约合成、工件复用与语义匹配,构建知识驱动的验证范式。

04:00
arXiv cs.AI

LVLMs与人类在指称交流中的“共同基础”方式不同

大视觉语言模型无法像人类一样通过多轮交互有效建立共同基础进行指称交流。

04:00
arXiv cs.AI

R1-SyntheticVL:生成模型合成的数据是否已为多模态大语言模型做好准备?

提出CADS方法,通过集体智慧与对抗学习自动合成优质多样数据,有效提升多模态大模型性能。

04:00
arXiv cs.AI

SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents

04:00
arXiv cs.AI

Position: Modular Memory is the Key to Continual Learning Agents

04:00
arXiv cs.AI

findsylls:一个语言无关的音节级语音分词与嵌入工具包

统一音节分割、嵌入和多粒度评估的语言无关工具包,支持可复现实验。

04:00
arXiv cs.AI

CogGen: 认知负荷启发的全无监督深度生成模型用于压缩采样MRI重建

提出基于认知原则的分阶段重建框架,通过自适应阈值策略提高MRI重建效率并抑制噪声。

04:00
arXiv cs.AI

Phys4D:基于视频扩散的细粒度物理一致4D建模

Phys4D通过三阶段训练从视频扩散模型学习物理一致4D表示,提升细粒度时空与物理一致性。

04:00
arXiv cs.AI

中文司法判决中法律论证结构的标注与可视化指南

提出法律论证结构标注框架,定义命题与关系类型,规范可视化与工作流,支持司法推理计算分析。

04:00
arXiv cs.AI

构造可判定:可信AI的设计时验证

基于阿贝尔群结构,在设计时验证AI稳定性、正确性与一致性,消除后验开销。

04:00
arXiv cs.AI

从论文到程序:在AI辅助量子多体代码生成中外化和诊断知识瓶颈

外化知识解决论文到代码歧义,但模型能力瓶颈仍存,需人机协作迭代。

04:00
arXiv cs.AI

当生活给你行为克隆,就造出Q函数:从行为克隆中提取Q值用于机器人在线强化学习

Q2RL算法从行为克隆中提取Q函数,通过Q门控在线切换策略,高效实现机器人强化学习,成功率提升至100%。

04:00
arXiv cs.AI

针对大型音频语言模型的成员推断攻击

首次系统评估LALM成员推断攻击,发现分布偏移干扰,提出盲基线协议,揭示跨模态记忆源于声音与文本绑定。

04:00
arXiv cs.AI

DPRM:扩散语言模型中基于Doob h变换的即插即用令牌排序模块

DPRM插件式排序模块,通过Doob h变换将置信度驱动逐步转为过程奖励引导,提升多种语言与DNA任务。

04:00
arXiv cs.AI

人机对齐下学习借助AI辅助进行决策

证明人机置信度对齐可降低AI辅助决策的学习复杂度,并给出遗憾下界与改进。

04:00
arXiv cs.AI

面向智能网络运维和AIOps的大语言模型:架构、评估与安全性

大语言模型驱动网络运维智能代理,需约束自主性、可靠评估及安全部署。

04:00
arXiv cs.AI

深度学习填补多光谱遥感数据

深度学习模型显著优于线性插值填补遥感缺失数据,CNN表现最佳,有效提升水质监测可靠性。

04:00
arXiv cs.AI

面向OOD区块链异常检测的时间模态感知图测试时自适应

提出TEMG-TTA,通过时间模态感知和测试时自适应,有效检测OOD区块链异常,性能平均提升54.88%。

04:00
arXiv cs.AI

面向可重用材料本体的多层次架构——以OntoCrafter陶瓷本体(OCO)为参考实现

提出多层次模块化本体架构,通过抽象层次与受众分类解决碎片化,以七层机制骨架实现深度解释。

04:00
arXiv cs.AI

MASCOT-Android:面向Android恶意软件源代码样本的精选数据集与自动化收集流程

构建Android恶意软件源代码数据集,利用README文档的线性SVC分类器实现自动化收集,准确率达96.28%。

04:00
arXiv cs.AI

NAVI-Orbital:零样本视觉语言模型在自主对地观测中的首次在轨演示

首次在轨演示零样本视觉语言模型,实现自主多模态推理和语义压缩,降低对地观测下行带宽需求。

04:00
arXiv cs.AI

CaVe-VLM-CoT: 一个可解释的视觉-语言模型框架

CaVe-VLM-CoT通过五阶段闭环框架实现证据驱动推理,减少幻觉,CaVeScore综合评估,在ScienceQA和MMMU上性能显著提升。

04:00
arXiv cs.AI

共享工作空间中的人机协同探索

研究发现共享工作空间人机协作中,缺乏协调会降低性能;共享记忆与人工在环门控可提升协同效果,协作方式与能力同等重要。

04:00
arXiv cs.AI

中文标题:DeFAb:面向基础模型的可废止溯因可验证基准

中文摘要:DeFAb基准将四十年知识库转化为可废止溯因实例,符号求解器100%准确,最佳前沿模型仅65%,渲染鲁棒性降至23.5%。

2026年6月17日
04:00
arXiv cs.AI

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

通过数字孪生与强化学习实现治疗响应优化的临床决策支持,安全高效且持续改进。

04:00
arXiv cs.AI

超越并行采样:面向智能体搜索的多样化查询初始化

标准并行采样因首轮查询冗余收益递减,DivInit多样化初始化在匹配计算量下提升多跳问答5-7点。

04:00
arXiv cs.AI

机器学习共病指数

提出MLCI,通过最大化nHSIC学习诊断代码评分,捕捉非线性风险关系,理论证明可统一排序,实验优于传统方法。

04:00
arXiv cs.AI

在位者优势:LLM推荐系统中的品牌偏见与认知操纵动态

知名品牌在LLM推荐中有脆弱垄断优势,权威营销可打破,多品牌竞争陷入社会困境。

04:00
arXiv cs.AI

MapSatisfyBench:通过行为隐含决策因素对满意度感知地图智能体进行基准测试

提出MapSatisfyBench基准,从行为链恢复用户隐含需求,评估满意度感知,发现现有智能体显式任务好但隐含因素满足不足。

04:00
arXiv cs.AI

通过智能体轨迹剖析模型行为

SSA框架分析138k轨迹,揭示模型意图-执行差距与行为差异,提升基准性能。

04:00
arXiv cs.AI

Brick-DICL: 面向自动砖石模式分类的动态上下文学习

Brick-DICL通过两阶段动态上下文学习与多模型过滤,自动分类建筑系统砖石模式,提升准确率并减少人工校验。

04:00
arXiv cs.AI

DecoSearch: 复杂度感知的文本到SQL路由与计划级修复

DecoSearch框架通过智能路由与执行失败的分解修复,在无需训练下提升SQL生成准确率,显著节省Token。

04:00
arXiv cs.AI

FinAcumen:基于自演进经验记忆系统的金融多模态推理

FinAcumen通过选择性激活经验记忆提升金融多模态推理可靠性,在四个基准上改进8B模型性能接近专有模型。

04:00
arXiv cs.AI

从酝酿到解析:追踪LLM中代码推理的内部生命周期

代码推理先酝酿答案,后分化四种结局,总解析率仅41.5%,失败模式因任务而异。

04:00
arXiv cs.AI

打破自回归诅咒:面向大语言模型的动态认知熵编排可擦除强化学习

E3RL以动态认知熵打破自回归诅咒,实现自愈推理,在数学基准上超越SOTA,4B/8B模型分别提升5.35%/6.51%。

04:00
arXiv cs.AI

同伦类型论推广神经符号推理

同伦类型论保留对称性与证明数,消除推理捷径,提升校准性能。

04:00
arXiv cs.AI

推理计算如何塑造前沿大语言模型评估

推理计算量显著影响评估结果,固定预算易低估能力,应依计算量报告并匹配预算比较。

04:00
arXiv cs.AI

StepGuard:通过单步校准保障网页导航

提出DDPO动态优化与CANR自适应校准机制,显著提升网页导航准确率,达新SOTA。

04:00
arXiv cs.AI

FlowRAG:通过频率感知多粒度图流协同显式推理

FlowRAG通过频率感知多粒度图流与双粒度激活,提升语义检索与显式推理,在复杂推理任务上达到最优。

04:00
arXiv cs.AI

图神经网络的结构保持性及其逻辑表达能力

从结构保持角度,用分级模态逻辑片段刻画图神经网络表达能力,对应嵌入、内射同态与同态。

04:00
arXiv cs.AI

Learn to Quantify Social Interaction with Constraints for Pedestrian Walking

04:00
arXiv cs.AI

DiagFlowBench:评估语言模型如何在基于流程的诊断对话中处理偏离规程输入

DiagFlowBench评估模型处理偏离规程输入,发现模型常选上下文不当的真实步骤,暴露脆弱性。

04:00
arXiv cs.AI

PreAct:在执行重复任务时速度更快的计算机使用代理

PreAct将首次成功执行编译为状态机,后续重放快8.5-13倍,并含校验与回退机制。

04:00
arXiv cs.AI

小初始化对大型语言模型至关重要

缩小初始化规模可提升大模型预训练效果,尤其增强推理能力,是低成本有效干预。

04:00
arXiv cs.AI

MoCo-AIS:一种用于船舶轨迹相似度计算的对比学习框架

基于动量对比学习框架,在真实AIS数据上显著提升船舶轨迹相似度计算性能。

04:00
arXiv cs.AI

大语言模型消费者行为理论:一个新研究领域的基础

本文提出LLM消费者行为理论,融合经济学与NLP,分析AI代理的消费决策与市场影响。

04:00
arXiv cs.AI

STAR:面向文本到图像强化学习后训练的时空自适应奖励分配

STAR利用文本-图像注意力动态分配奖励,精准更新策略,在GenEval、OCR、PickScore上达最优。

04:00
arXiv cs.AI

ProvenanceGuard:面向基于MCP的LLM智能体的源感知事实性验证

提出ProvenanceGuard源感知验证器,解决MCP智能体跨源归因错误,医疗领域有效检测并修复,证明源归属是事实性验证独立维度。