5919 条条目 · 106 个活跃源
2026年7月27日
04:00
ArXiv AI

LeafData:一个用于数据迁移的智能代理系统

LeafData通过智能代理将用户意图转化为可执行JSON配置,实现异构数据迁移,无需手动编码。

04:00
ArXiv AI

小波相位扩散实现结构与语义一致的仿真到真实转换

小波相位扩散利用双树复小波包与低频随机化,实现仿真到真实的高保真转换,兼顾结构与语义一致性。

04:00
ArXiv AI

学习型命令适配器何时值得?冻结运动策略的闭环识别与反事实审计

通过对比实际增益与反事实上限,审计判定适配器仅在可观测信号证明状态依赖改进时值得部署。

04:00
ArXiv AI

模块是否各司其职?复合LLM系统中的角色漂移

端到端RL导致模块角色漂移(如分解器植入答案),准确率掩盖真实学习;Role Anchor正则化可缓解,但需牺牲部分准确率。

04:00
ArXiv AI

定义AI原生系统:自主性作为修订权威

论文从决策权威角度定义AI原生:AI自主重写系统实现,需升级检测、验证与回退,人保留目的与正确性。

04:00
ArXiv AI

持久计算状态:面向生成式世界模型的会话中心运行时

世界模型失败因运行时丢弃不可重计算状态,定义持久计算状态并构建会话中心运行时,极低开销支持大量会话。

04:00
ArXiv AI

AI红队评估的证明边界

红队评估的证据上限可计算,区分能证明与不能证明的边界,现有基准对罕见严重危害证据不足。

04:00
ArXiv AI

DAGForge:基于生物医学文献的可审计因果有向无环图创作

利用文献和大语言模型构建可审计因果DAG,支持证据追溯与专家审查。

04:00
ArXiv AI

从季节性到语义:玻利维亚路障事件混合概率预测系统的基准测试

混合系统(Prophet+NLP)优于纯统计模型,AUC-ROC达0.677,Brier分数降10.9%,利用新闻语义信号捕捉社会紧张高峰。

04:00
ArXiv AI

QLPO:基于象限加权的长度感知策略优化采样

QLPO通过重采样隐式控制响应长度,保持正误比例并偏向短正确长错误,减少30%-70%长度且不损推理性能。

04:00
ArXiv AI

TRW: TRACE-RealWorld——作为物化视图的世界模型的可审计一致性契约

提出可审计一致性契约,通过有效性抽象、自适应维护、事务补偿和溯源,解决物理世界数据管理问题。

04:00
ArXiv AI

学习伴随推理展开:高效强化学习的渐进式展开分配

VIGOR基于方差引导动态分配展开预算,比GRPO减少最多2.3倍展开,提升效率。

04:00
ArXiv AI

退化税:解析技能为何对LLM智能体既有利又有弊

技能使代理既进步也倒退,最佳技能赢在少退化而非多增益,三大退化根源在于忽视基础与验证。

04:00
ArXiv AI

IDEAgent:用于研究想法生成的自主质量-多样性搜索

IDEAgent多智能体框架通过质量-多样性联合搜索优化研究想法,在8领域32主题上Yield提升3.89倍。

04:00
ArXiv AI

SceneActBench:智能体能对所见的三维场景采取行动吗?

提出SceneActBench,评估VLM智能体在五种3D任务中的行动能力,结果显示无模型持续表现良好。

04:00
ArXiv AI

Analyzing Middle School Students' Dialogue and Behaviors during Collaborative AI Chatbot Development Using Ordered Network Analysis

04:00
ArXiv AI

生成式与多模态AI在材料预测与设计中的应用:进展、挑战与展望

AI加速材料预测但新颖性难证实,需多模态数据标准与证据综合以设计可实验实现的新材料。

04:00
ArXiv AI

局部突触规则可在无反向传播情况下实现SIGReg梯度

两种局部突触规则无需反向传播即可实现SIGReg梯度,时序输入使聚类分离度提升三倍,MNIST准确率达87.3%。

04:00
ArXiv AI

工具引导的检索增强修复以保障LLM生成的C代码安全

结合编译诊断、静态分析与检索修复模式,将安全缺陷率从49%降至19%。

04:00
ArXiv AI

模拟量子电路会改变CNN的注意力吗?——医学图像分类中的性能与可解释性比较

混合量子CNN在中等数据时优于经典CNN,大数据下经典更优;无纠缠模拟扩展性更好。

04:00
ArXiv AI

STEM领域图像描述技术的系统性综述

综述AI描述STEM图像技术:转向交互多模态,但面临事实错误、数据稀缺挑战。

04:00
ArXiv AI

跨模型LLM代码审查:应该用Claude审查Codex还是反之?

用Claude审查Codex可提升通过率至89.7%,反向则降低,建议用Claude审查Codex。

04:00
ArXiv AI

星载SAR图像中RCS建模的深度西格玛点过程

提出深度西格玛点过程模型,预测RCS降低RMSE 20.83%,提升R² 25.89%,提供不确定性估计。

04:00
ArXiv AI

基于LLM的偏好代理的协同设计:参与可能引发过度信任

协同设计偏好代理时,参与和透明度易引发过度信任,掩盖人-代理对齐不足的结构性后果。

04:00
ArXiv AI

增强小语言模型实现射电天文学可持续代码优化

通过多采样和编译器反馈增强小语言模型,实现代码优化并节能,效果超越大模型。

04:00
ArXiv AI

统一静态-动态剪枝实现高效LLM推理

提出SPDP统一框架,协同格式与GPU内核,实现静态与动态剪枝融合,推理加速1.24-1.37倍(最高2.51倍),稀疏度提升25%且困惑度不变。

04:00
ArXiv AI

面向因果推断的干预得分几何

提出干预得分几何,定义因果影响为边际干预得分导数,引入Fisher信息度量,区分观测与干预得分,明确因果阶梯层次。

04:00
ArXiv AI

ACME:一个多文化、多形态的社会导航数据集

ACME:跨文化多形态社交导航数据集,含5国8站点7种机器人数据,推动复杂场景下人机交互研究。

04:00
ArXiv AI

参数与边值问题的广义神经算子

广义神经算子显式条件化PDE参数和边界,结合三个新型组件,实现高效推理与物理严谨的强泛化。

04:00
ArXiv AI

Active Directory安全加固的实用图优化与AI驱动模型

针对AD攻击图动态性、主动防御不足及管理员反馈问题,提出博弈优化模型实现蜜罐部署与自适应优先级决策。

04:00
ArXiv AI

基于角色访问控制的文本到SQL基准测试

提出RBAC约束下的文本到SQL评测框架,发现高分开源LLM在访问控制环境中性能骤降。

04:00
ArXiv AI

Teachy Mini:面向高等教育的知识驱动型生成式社交机器人的开发与初步评估

基于知识设计的Teachy Mini机器人展现出更负责任的辅导行为,可能提升学习效果。

04:00
ArXiv AI

自校准智能体AI框架用于自主边缘资源分配

自校准智能体框架通过ARIMA预测器动态近似地面真值,使边缘资源预测准确率提升91.7%,速度提升71.7%。

04:00
ArXiv AI

HiKV:面向LLM解码的层次化重要性感知KV缓存与硬件加速

提出层次重要性感知压缩KV缓存的算法-硬件协同设计,实现7.95倍加速和90%能耗降低,精度损失<1%。

04:00
ArXiv AI

PRIMS:多模态传感中流体识别的物理引导表示

PRIMS提出物理引导Transformer,嵌入流体力学知识,实现动态条件下高精度(F1=98.92%)、参数少14倍、强泛化的流体识别。

04:00
ArXiv AI

拆解面向艺术创作的扩散模型:交互式模型弯曲与基于实践的可解释性

通过可视化模型内部结构,实现交互式模型弯曲,让艺术家在实践中理解扩散模型不同组件的影响。

04:00
ArXiv AI

整数线性规划精确数据驱动逆优化的显式迭代复杂度

本文给出了整数线性规划中精确数据驱动逆优化问题的显式迭代复杂度,作为样本数、特征维度等参数的函数。

04:00
ArXiv AI

学习时空决策先验用于部分可观测下的高效路径规划

ImiPath从历史轨迹学习时空决策先验,引导部分可观测路径规划,减少冗余节点扩展,提升搜索效率。

04:00
ArXiv AI

集成推理系统以实现可信AI——第四届逻辑与编程实践(LPOP)研讨会论文集

聚焦集成推理和规则约束编程融合,构建可信AI。

04:00
ArXiv AI

DeepFeature:基于大语言模型的上下文感知可穿戴生物信号特征生成

首个结合大语言模型与专家知识的可穿戴生物信号特征生成框架,在8项任务中平均AUROC提升4.56%和4.61%。

04:00
ArXiv AI

分析八个大型语言模型的伦理逻辑

研究八个大模型的伦理逻辑,发现其道德判断趋同但存在差异,提出可增强对AI理解。

04:00
ArXiv AI

从心智到机器:Manus AI作为全自主数字智能体的崛起

Manus AI是2025年初推出的通用自主智能体,融合推理与执行,跨领域应用,开启人机协作新时代。

04:00
ArXiv AI

Re-FORC:面向高效思维链推理的自适应奖励预测

Re-FORC通过自适应奖励预测,实现推理早停、模型优化与动态缩放,减少计算26%,提升峰值准确率1.7%及测试时准确率9.9%。

04:00
ArXiv AI

推理模型的统计早停法

提出两种统计早停方法,监测不确定性信号提升LLM推理效率与可靠性,尤其数学推理。

04:00
ArXiv AI

广义高斯时序差分误差用于不确定性感知强化学习

提出基于广义高斯分布的TD误差建模,通过形状学习与BIEV正则化提升不确定性感知性能。

04:00
ArXiv AI

超越文本到SQL:大语言模型真的能调试企业ETL SQL吗?

首个企业SQL调试基准OurBench,含语法/语义错误,LLM准确率最高仅36%,揭示巨大性能差距。

04:00
ArXiv AI

同一世界,不同呈现:人工智能体中的历史依赖感知重组

提出最小架构,使智能体基于历史视角对相同观察产生不同感知编码,实现感知而非行为重组。

04:00
ArXiv AI

大型语言模型在机器人健康助手控制中的安全性基准测试

评估72个LLM,平均违规率54.4%,闭源模型更安全,医学微调无显著改善,安全性需作为首要标准。

04:00
ArXiv AI

用于研究GenAI学习的数学教育数字影子:LLM中的数学表现、焦虑和信心

MEDS数据集分析14个LLM在数学任务中的表现,发现其存在人类类似的态度、逻辑谬误和过度自信。

04:00
ArXiv AI

AuditRepairBench:面向智能体修复中评估通道排名不稳定性的配对执行轨迹语料库

发布AuditRepairBench语料库,可检测并减少智能体修复中评估通道导致的排名不稳定性,排名位移降55-74%。