5419 条条目 · 106 个活跃源
2026年7月7日
04:00
arXiv cs.AI

跨调查迁移的硅基采样

跨调查迁移评估LLM模拟人类受访者,零样本预测准确率52%,揭示可预测层级与模型局限。

04:00
arXiv cs.AI

使用Incognita评估社会分布任务环境中具身行动的生成式智能体

提出Incognita框架,评估生成式智能体在社会分布任务环境中的表现:强模型知识获取和操作尝试增多,但可靠性仍低,成功率最高17.2%。

04:00
arXiv cs.AI

面向代理式业务流程执行的组织记忆

提出组织记忆架构,提供共享、可治理的参考知识层,解决代理流程的知识孤岛问题。

04:00
arXiv cs.AI

基于关键感知自反馈重试的智能体强化学习

提出PivoARL框架,通过识别关键错误轮次进行局部重试,提升任务成功率并减少交互成本。

04:00
arXiv cs.AI

从移动数据到商业洞察:面向大规模城市移动分析与决策支持的端到端分析框架

利用移动数据构建端到端框架,实现移动画像、轨迹挖掘和异常检测,支撑城市与商业决策。

04:00
arXiv cs.AI

应用带模糊隶属函数的回答集编程:一个案例研究

提出模糊回答集编程扩展,用学习隶属函数与语义谓词桥接数值与定性推理,支持模糊环境稳健推理。

04:00
arXiv cs.AI

如何避免辩论:通过双重高效交互证明实现可扩展的AI安全

本文提出无需辩论的单证明者交互证明,双重高效验证AI安全,适用于鲁棒计算或低阶多项式预言机。

04:00
arXiv cs.AI

严谨性在人工智能中的角色

AI缺乏严谨科学基础却能力惊人,从概念、认知、操作三方面剖析矛盾,解释其快速进展与不确定性根源。

04:00
arXiv cs.AI

使用确定性真实值评估长文本生成中LLM的不确定性

提出SALT基准评估长文本不确定性,发现原子级置信度排名失效,推理带来准确性-排名权衡。

04:00
arXiv cs.AI

PLACEMEM:面向终身代理的计算感知内存平面

PLACEMEM提出版本化胶囊记忆,统一语义与状态,实现可纠正的控制平面,支持实时检索与级联失效。

04:00
arXiv cs.AI

可解释AI筛查孟加拉国儿童虐待相关创伤:基于噪声感知合成数据评估的无训练多模态框架

提出ShishuRaksha AI无训练多模态框架,融合问卷、叙事、绘画和表情,合成数据评估AUC 0.874,助力资源匮乏地区儿童创伤筛查。

04:00
arXiv cs.AI

基于激活几何的无监督特征挖掘

提出MAG无监督框架,通过指令改变模型内部表示提取推理特征,实现预测、引导决策及数据集选择,准确率94.7%。

04:00
arXiv cs.AI

HAS-Bench:在可配置人类参与下评估基于LLM的人机智能体系统

HAS基准评估人类参与LLM智能体系统,发现收益取决于参与时机、方式和角色。

04:00
arXiv cs.AI

主体控制的生物基序

论文用生物基序分析智能体系统,映射五种模式到软件设计,提出可组合语法、认识拓扑及四个可预测定理,附实现验证。

04:00
arXiv cs.AI

法律判决预测中的捷径学习:来自英国就业法庭的经验证据

本文发现法律判决预测模型利用事后文本泄露特征获得高绩效,但遮蔽泄露后仍能有效预测,性能损失甚微。

04:00
arXiv cs.AI

语言模型通过控制搜索引导符号方程发现

语言模型作为搜索控制器,在符号方程发现中平衡精度、复杂度、稳定性和成本,有效识别紧凑关系。

04:00
arXiv cs.AI

基于聚类的资本市场可疑交易模式识别框架

用K-Means++聚类分析百万笔交易,识别2.02%可疑(涵盖幌骗等),轮廓系数0.561。

04:00
arXiv cs.AI

智能体物联网:迈向智能体互联网的架构、应用与挑战

提出Agentic IoT范式,融合自主AI智能体与IoT,构建分布式认知生态系统,并综述架构、应用与挑战。

04:00
arXiv cs.AI

GUI智能体相信自己的眼睛吗?诊断状态信念对像素与结构的依赖

提出视觉状态依赖度量,发现文本智能体过度依赖结构而非像素,导致行动错误。

04:00
arXiv cs.AI

基于深度学习和机器学习的FPS游戏服务器端自瞄作弊检测

提出YAACS自瞄检测系统,堆叠LSTM序列建模准确率88.6%,假阳性率0.97%,优于决策树,证明时序建模可减少误报。

04:00
arXiv cs.AI

通过投注机制实现LLM预测的分散聚合

WALLA通过投注机制分散聚合LLM预测,具备激励相容、优势对齐和分散学习,性能媲美集中式方法。

04:00
arXiv cs.AI

为何纯推理不足:自然作为数学创新的源泉

人类数学创新依赖自然启发的模式匹配,而非纯演绎;这为大型语言模型的海量跨领域数据提供了理论依据。

04:00
arXiv cs.AI

注意力受限的奖励学习

有限注意力会扭曲成对比较数据,标准模型无法区分奖励与注意力的影响,反馈应视为受限测量过程。

04:00
arXiv cs.AI

MRMS:面向长期AI代理的多分辨率记忆基底

提出多分辨率记忆基底MRMS,通过同步结构化-向量-图形记忆实现长期AI代理的可靠个性化与记忆管理。

04:00
arXiv cs.AI

受控个体化:用密码学将智能体的学习与其权限解耦

通过加密身份和语义门控,保证自主学习的智能体权限不越界,是架构不变性而非概率结果。

04:00
arXiv cs.AI

融合利他与公平偏好促进顺序社会困境中的高级相互合作

AFP奖励共享机制融合利他与公平偏好,使智能体在顺序社会困境中实现高级相互合作,提升集体奖励与公平性。

04:00
arXiv cs.AI

STAPO:面向LLM智能体训练的选择性轨迹感知策略优化

提出归一化熵与STAPO框架,缓解轨迹忽略问题,在多个基准任务上取得最优性能。

04:00
arXiv cs.AI

FM-ChangeNet: 基于路径特征传输的变化学习

通过路径监督将变化检测转化为特征空间连续传输,利用速度场幅度区分真实变化与干扰,性能最优。

04:00
arXiv cs.AI

CARL:面向LLM规划的约束感知强化学习

提出CARL框架,通过约束感知奖励增强LLM对约束的关注,无需外部工具,显著提升规划可靠性。

04:00
arXiv cs.AI

Medi-Gemma:一种结合确定性EMR分析与检索增强生成的混合型临床决策支持系统

Medi-Gemma通过解耦框架与真值注入,消除语义漂移,提升临床决策事实准确性。

04:00
arXiv cs.AI

重新审视思维模型的在线策略自我蒸馏

特权自我蒸馏会损害思维模型的长推理能力,导致准确率最高下降17%,因高熵分叉处学习重塑。

04:00
arXiv cs.AI

推理、奖励、修正:基于结构化反馈的小语言模型物理推理步骤级错误修正

提出步骤级奖励框架,识别首个错误并生成结构化反馈训练自修正,免真值数据。物理基准准确率提升17-20%,计算与理解错误显著减少。

04:00
arXiv cs.AI

MetaSkill-Evolve:基于双时间尺度元技能演进的LLM智能体递归自我改进

提出双时间尺度框架实现LLM智能体递归自我改进,任务技能快进、元技能慢进,三项基准测试准确率均显著提升。

04:00
arXiv cs.AI

EvoAgentBench:基于能力转移的智能体自我进化基准

EvoAgentBench通过能力图与痕迹验证评估智能体自我进化中过程性经验的转移,揭示现有自动方法难以持续正增益。

04:00
arXiv cs.AI

SiamixFormer:一种基于全变换器的孪生网络,用于双时相遥感图像中精准建筑物检测与变化检测

提出SiamixFormer模型,利用灾前灾后图像及时间变换器融合特征,在建筑物检测和变化检测任务上达到最优。

04:00
arXiv cs.AI

AutoResearch:一种基于执行可靠性的多智能体框架,用于研究工作流自动化

提出AutoResearch多智能体框架,结合沙盒执行与引用验证,显著提升科研工作流自动化可靠性。

04:00
arXiv cs.AI

PotatoGANs:利用生成对抗网络、实例分割和可解释人工智能增强马铃薯病害识别与分类

利用两种GAN生成合成病害图像缓解过拟合,CycleGAN图像质量更优,结合可解释AI提升分类性能。

04:00
arXiv cs.AI

LLM作为验证器:一种通用验证框架

提出LLM-as-a-Verifier框架,通过连续评分实现细粒度验证,无需额外训练,在多个基准达SOTA并提升RL效率。

04:00
arXiv cs.AI

用于玻色子量子计算的SRF腔和Transmon的神经网络逆向设计

提出两种深度神经网络逆向设计SRF腔和Transmon,匹配精度分别达~5%和~2%,快速替代迭代仿真。

04:00
arXiv cs.AI

GLM-5服务参数调优:面向OpenClaw的长上下文智能体工作负载单部署MaaS推理优化

通过调优chunked prefill、TP、PP等参数,最佳配置提升吞吐量与降低延迟,成本降低约10%。

04:00
arXiv cs.AI

评估与理解医学视觉语言模型的模型编辑

提出M3Bench基准,含16k问题评估医学VLM编辑,发现梯度法缺局部性、记忆法缺组合泛化性。

04:00
arXiv cs.AI

图稀疏采样:打破连续MDP规划中的规划期限诅咒

提出图稀疏采样(GSS),共享采样避免分支爆炸,实现规划期限多项式依赖的在线连续MDP规划。

04:00
arXiv cs.AI

并非每次同步都安全:面向共享AI基础设施的校准DiLoCo调度

提出校准DiLoCo调度,结合EWMA预测,显著降低SLO违反(6.54%→5.09%),强调匹配随机基线验证。

04:00
arXiv cs.AI

PEEK: 预测性队列信息驱动的LLM服务KV缓存管理

PEEK通过增量前缀树匹配队列请求,优先调度共享前缀,显著提升KV缓存命中率与LLM服务性能。

04:00
arXiv cs.AI

AI时代美国超大规模数据中心隐藏的水资源地理

数据中心用水分现场冷却和发电两路径,电力相关占七成五,西部水紧张,东部集中。

04:00
arXiv cs.AI

不是所有拒绝都同等:大规模网络安全中安全对齐的失败

通过对24个开源LLM的消融实验,发现领域特定消融可行,安全训练类型与架构是关键因素,模型分为三个易受影响层次。

04:00
arXiv cs.AI

COMET:基于约束保持QAOA的多重编辑靶点组合优化

COMET比较惩罚与XY混合器QAOA,XY混合器在模拟和硬件上优于惩罚,实现高概率最优解。

04:00
arXiv cs.AI

LLMoxie:探索面向科学软件开发的智能体AI

LLMoxie平台通过三层架构与RSE插件,使AI编码代理成为领域感知、可审计的协作者。