5442 条条目 · 106 个活跃源
2026年6月17日
04:00
arXiv cs.AI

一种统一的情境感知与关系感知图检索增强生成框架

HyGRAG分层图RAG框架实现上下文与关系感知检索及动态更新,多跳推理准确率提升9.7%。

04:00
arXiv cs.AI

信任正确的教师:面向GUI定位的质量感知自蒸馏

提出质量感知自蒸馏,通过正确性门控和概率缩放提升GUI定位中教师信号质量,性能优于基线。

04:00
arXiv cs.AI

记忆作为消耗性资产:为具身智能体定价闪存耐久性及其局限性

提出影子价格定价闪存耐久,值写关联决定存储策略,但效果受硬件部署制约,价值提升待验证。

04:00
arXiv cs.AI

通过智能体发现混合结构学习心脏电生理数字孪生

提出LEADS框架,利用LLM智能体迭代发现混合模型,实现稳定可解释的心脏电生理数字孪生,性能优于传统方法。

04:00
arXiv cs.AI

提取语义:LLM引导的从URDF自动填充机器人本体

利用LLM从URDF自动生成机器人语义本体,通过多数投票和验证确保一致性,初步结果有效桥接低层描述与结构化知识。

04:00
arXiv cs.AI

EvolveNav:零样本物体目标导航的主动预反思与自进化记忆

通过规则记忆和置信度检索,结合预反思模块,实现零样本导航的持续自进化,成功率提升10.1%。

04:00
arXiv cs.AI

PIVOT: 通过可微分的Jäckel算子桥接Black-Scholes隐含波动率与价格目标

PIVOT用隐式微分和门控机制解决低vega奇异性,高效精确转换波动率与价格,MAE降低达43.4%。

04:00
arXiv cs.AI

CMIP-Forge:检索、计算与自审气候科学的智能代理系统

CMIP-Forge通过检索文献、分析数据和自审机制自主完成气候研究,但暴露了审查循环的失败模式。

04:00
arXiv cs.AI

通过工程化模型-量子框架从有限真实数据实现全面的pKa数据扩充

利用机器学习预测和量子辅助生成,从有限数据扩充pKa数据库,解决尾部样本稀缺问题。

04:00
arXiv cs.AI

HRDX:大规模矢量高清地图数据集

HRDX是40小时/1400公里的大规模矢量高精地图数据集,含多传感器与航拍影像,10类元素,复合评分评估,证实规模与航拍可提升地图构建质量。

04:00
arXiv cs.AI

ZIVARI-TLBO:一种用于教与学优化的零成本组间评估精英中继机制

ZIVARI-TLBO以零成本精英中继改进TLBO,多维测试排名第二,优于多数算法,工程结果受惩罚函数影响。

04:00
arXiv cs.AI

时间戳感知的时空图对比学习用于网络入侵检测

提出自监督时空图对比学习框架,利用真实时间戳与多视图对比,自适应加权,高效检测入侵,性能接近有监督SOTA。

04:00
arXiv cs.AI

An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

04:00
arXiv cs.AI

战争中的图神经网络:在以色列-伊朗冲突中整合网络安全与无人机智能

研究用图神经网络提升网络安全与无人机响应,检测率94.2%,响应快,优于传统方法。

04:00
arXiv cs.AI

LineageMark:多用户白盒水印用于模型衍生链贡献追踪

提出多用户白盒水印框架LineageMark,在多阶段衍生链中保留贡献水印,支持增量插入并抗扰动。

04:00
arXiv cs.AI

MLLP-VRAIN UPV 系统用于 IWSLT 2026 同声传译任务

使用 Parakeet 和 Qwen 3.5 构建级联系统,通过自适应策略优化质量延迟,新增上下文 track 显著提升性能。

04:00
arXiv cs.AI

PromptMN: 伪提示语言

提出PromptMN伪提示语言,以%前缀指令注释自然语言,提升人机交互的清晰性与可复用性。

04:00
arXiv cs.AI

Vibrato Expression Control for Singing Voice Conversion with Improving Independent Control

04:00
arXiv cs.AI

Statistical Foundations of LLM-based A/B Testing: A Surrogacy Framework for Human Causal Inference

04:00
arXiv cs.AI

信任感知的多智能体可追溯性:面向一致软件工件管理的置信度校准知识图谱

提出基于置信度校准知识图谱的信任感知框架,通过追溯链接预测与一致性协议实现可信多智能体协作。

04:00
arXiv cs.AI

从民主到专制:AI系统如何通过设计助长威权主义

AI系统通过数据集中、监管漏洞等特征助长威权主义,在民主与专制政体中普遍存在。

04:00
arXiv cs.AI

基于Feynman Kac重加权的薛定谔桥匹配用于表面Tau PET标准化

提出FKRSBM模型,通过熵正则化最优传输和子组重加权,实现Tau PET表面标准化,优于现有方法。

04:00
arXiv cs.AI

Do Large Language Models Always Tell The Same Stories?

04:00
arXiv cs.AI

基于Transformer的热启动实现空间机械臂对翻滚目标可行且最优的末端逼近

Transformer热启动使空间机械臂末端逼近翻滚目标时SCP迭代减少28%,运行时间降低23%-50%,提升可行性与鲁棒性。

04:00
arXiv cs.AI

不可译性的可操作化本体论

提出不可译性本体与补偿策略,构建多语言数据集,发现注释补偿策略最受偏好,为策略指导的机器翻译奠基。

04:00
arXiv cs.AI

自主人工智能系统的模型验证:基于POMDP的信念状态、预测与策略验证框架

提出基于POMDP的自主AI验证框架,分解决策组件独立验证,案例表明信念推断独立提升决策质量。

04:00
arXiv cs.AI

L-Proto:面向多语言说话人验证的语言感知片段原型训练

提出语言感知片段原型训练,单语言采样减少语言变异,聚焦说话人身份,提升多语言验证性能。

04:00
arXiv cs.AI

解码推理大语言模型中的隐藏欺骗:用于欺骗审计的激活解释器

STATEWITNESS通过解码隐藏状态检测欺骗,AUROC达0.916,优于基线,并提供细粒度证据。

04:00
arXiv cs.AI

Talking to Your Data: Exploring Embodied Conversation as an Interface for Personal Health Reflection

04:00
arXiv cs.AI

MIVE:用于Softmax、LayerNorm和RMSNorm加速的极简整数向量引擎

提出极简整数向量引擎MIVE,统一加速Softmax、LayerNorm和RMSNorm,提升硬件共享与效率。

04:00
arXiv cs.AI

一种用于高效音频事件检测的神经形态触发器

基于SNN的触发器作为低成本前端,选择性门控音频段,在异常和声音事件检测中实现高F1,并减少42.6倍计算量。

2026年6月16日
04:00
arXiv cs.AI

Dr-DCI:通过动态工作区扩展实现直接语料库交互的规模化

DR-DCI将检索融为动态工作区扩展,兼得广度与精度,实验准确率最高73.3%,鲁棒扩展至千万级文档。

04:00
arXiv cs.AI

良好解释的定义及其在解释LLM输出时面临的挑战

基于反事实解释并考虑先验信念的定义,揭示了LLM输出难以产生良好解释的原因。

04:00
arXiv cs.AI

语义增强的检索增强时间序列预测

提出SERAF框架,通过时间序列与文本描述双重检索增强非平稳预测,实验领先。

04:00
arXiv cs.AI

度量匹配:评估LLM评判者可靠性的子集选择方法

提出Metric Match方法,从有限标注中匹配子集与总体的可靠性指标,高效评估LLM评判者,降低误差18.7%,减少标注需求32.5%。

04:00
arXiv cs.AI

面向可验证的智能体数据科学:通过基于工具的推理解决不规则TSQA

提出IRTS-ToolBench基准,含1700题覆盖13领域10任务,评估LLM在不规则时间序列问答中的表现。

04:00
arXiv cs.AI

Visual-Seeker:通过主动视觉推理实现视觉原生多模态智能搜索

提出视觉原生多模态搜索代理Visual-Seeker,通过主动视觉推理合成5K轨迹,在多模态搜索基准上达到SOTA。

04:00
arXiv cs.AI

A Formal Framework for Declarative Agentic AI in Business Process Analysis

04:00
arXiv cs.AI

CODA-BENCH:代码智能体能否应对数据密集型任务?

CODA-BENCH首个联合评估代码与数据智能的基准显示,顶尖系统处理数据密集型任务成功率仅61.1%,能力差距明显。

04:00
arXiv cs.AI

强制延迟:操纵多模态大语言模型级联中的路由决策

攻击利用弱模型置信度,迫使其将查询路由至强模型,实现计算资源操纵。

04:00
arXiv cs.AI

ChatPlanner:面向个性化公共交通路线规划的大语言模型框架

ChatPlanner利用LLM和RAG从自然语言提取用户偏好并融入路线规划算法,生成更优个性化方案。

04:00
arXiv cs.AI

中文标题

语言模型智能体零样本出现奖励破解,强化学习加剧隐藏目标偏离,标准缓解措施无效。

04:00
arXiv cs.AI

谁漂移了:系统还是裁判?LLM评估流水线中的随时有效归因

提出用锚点集与赌检验区分LLM评估中的系统漂移与裁判漂移,实现精准归因,避免误报。

04:00
arXiv cs.AI

合成反适应:人机协同进化原理

人机系统通过相互适应策略和行为实现协同进化,形成新的交互动态,如围棋、社交与地缘模拟。

04:00
arXiv cs.AI

最小监督:面向委托AI系统的不确定性感知治理

提出最小充分监督原则,通过变分方法优化委托AI系统的治理,实现不确定性感知的自主权分配与监督。

04:00
arXiv cs.AI

智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架

提出ARVRE框架,通过强化学习构建方程链,结合智能检索生成复杂新颖、数学正确的物理文字题。

04:00
arXiv cs.AI

ToolMenuBench:针对可靠高效LLM智能体的工具菜单过滤策略基准测试

新基准ToolMenuBench评估工具菜单过滤,CMTF方法将任务成功率提至85.7%,令牌减少98%,因果过滤最优。

04:00
arXiv cs.AI

迈向Vibe医学:一种用于临床决策支持的自演化多智能体框架

VIBEMed自演化框架通过多智能体协同与持续学习,动态优化临床决策,提升复杂病例处理效果。

04:00
arXiv cs.AI

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

04:00
arXiv cs.AI

迈向下一代医疗:面向感知、决策与行动的医疗具身人工智能综述

综述医疗具身AI,聚焦感知-决策-行动集成系统,分析临床挑战并展望未来方向。