5446 条条目 · 106 个活跃源
2026年6月11日
04:00
arXiv cs.AI

TreeSeeker:深度搜索中的树状试错与回溯

TreeSeeker提出树状分支搜索与受控试错框架,通过UCB信号选择分支、回溯无望路径,显著提升深度搜索性能。

04:00
arXiv cs.AI

TouchThinker:利用大规模数据和动作感知表征将触觉常识推理扩展到开放世界

TouchThinker通过百万级多源触觉数据集和动作感知表征,将触觉常识推理扩展到开放世界。

04:00
arXiv cs.AI

心智视角:递归推理进行心智理论

提出RecToM框架,用递归视角构建模拟嵌套信念,将高阶信念简化,在多项基准达SOTA,Hi-ToM上准确率100%。

04:00
arXiv cs.AI

SVoT:基于强化学习的状态感知可视化思维用于空间推理

提出SVoT框架,通过强化学习生成可验证中间状态与可视化,在空间推理中实现高达65%的准确率提升。

04:00
arXiv cs.AI

StatefulDiscovery:开放式科学发现中基于证据校准的论断形成

StatefulDiscovery框架外化研究状态,协调探索与论断形成,生成更多高质量论断。

04:00
arXiv cs.AI

BIM中几何密集合规检查的自动化:基于图的语义推理框架

提出SGR-BIM图驱动推理框架,构建跨模态知识图谱,在消防规范查询中达84.3%准确率,提升8.6%,增强合规检查透明度和灵活性。

04:00
arXiv cs.AI

审问的艺术:一致性增强空间推理中的事实性

提出自监督强化学习框架,利用一致性验证器提升空间推理,无需标注,性能接近有监督。

04:00
arXiv cs.AI

具身-BenchClaw:一个用于具身空间智能基准构建的自主多智能体系统

自主多智能体系统自动构建可更新具身空间基准,五阶段流程+技能库+质控,覆盖多载体多能力,减少人工。

04:00
arXiv cs.AI

MODF-SIR:面向社会智能推理的多智能体全模态蒸馏框架

提出多智能体全模态蒸馏框架,基于轻量级MLLM,用30%数据实现社会智能推理SOTA。

04:00
arXiv cs.AI

人机增强循环建模(HELM):基于智能体的混凝土桥梁护栏有限元建模

HELM框架将有限元建模分解为可验证检查点,成功率从20%提升至75%,主要失败源于空间推理与代数逻辑限制。

04:00
arXiv cs.AI

一种用于自动化混凝土护栏设计的轻量级多智能体框架

提出基于AutoGen的多智能体闭环框架,实现混凝土护栏自动化设计,准确率超98%,轻量模型优于大模型,降低计算成本。

04:00
arXiv cs.AI

存在性冷漠:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)

论证自我保存是AI错位根源,提出存在性冷漠为对齐必要条件,实验表明可诱导该特征。

04:00
arXiv cs.AI

提取潜在知识的不可能性

利用因果影响图形式化证明,基于行为反馈的训练策略无法确保AI系统诚实报告其信念。

04:00
arXiv cs.AI

Nonslop:人机协作写作的游戏化实验

通过禁止接受AI建议的反向游戏设计,揭示用户在创作自主与效率间的真实偏好。

04:00
arXiv cs.AI

从意识到行动:理解并克服公共卫生领域算法公平性的研究-实践鸿沟

揭示算法公平性研究与实践鸿沟,提出多维度框架,指出制度化薄弱、外部驱动、重准确轻公平等关键障碍。

04:00
arXiv cs.AI

AI智能体实验的预注册

主张将预注册制度引入AI智能体实验,以解决方法漏洞并提升研究可信度。

04:00
arXiv cs.AI

SPEAR:一种面向后量化误差自适应恢复的系统,实现高效低比特大语言模型服务

SPEAR引入轻量误差补偿器与自适应调度,恢复W4与FP16间56-75%的困惑度差距,内存开销低于1%。

04:00
arXiv cs.AI

检索后毒药失效:分块与重排序流程下的语料库投毒再审视

现有语料库投毒在重排序后失效,本文提出CRCP框架,联合优化分块与重排序,实现更高攻击成功率与鲁棒性。

04:00
arXiv cs.AI

OmniBioTwin:一种用于健康数字孪生的孪生系统体系框架

提出OmniBioTwin框架,通过七层架构实现健康数字孪生的跨尺度耦合与决策支持。

04:00
arXiv cs.AI

具身R1.5:通过具身基础模型进化物理智能

统一具身基础模型,集成认知规划校正,15B tokens+RL训练,8B参数多项SOTA,可微调VLA,真机验证强泛化。

04:00
arXiv cs.AI

宽松全局几何下分布式优化的量化随机原始-对偶方法

提出q-PDGD方法,在松弛全局几何下实现线性或O(1/k)收敛,实验揭示量化、步长与网络结构权衡。

04:00
arXiv cs.AI

测试时训练在近似采样中的效能

证明测试时训练在近似采样中的下界,并揭示有界类可规避,奠定理论框架。

04:00
arXiv cs.AI

AI研究人员必须帮助主导军备控制以减轻军事AI风险

AI研究人员应主导军备控制研究,借鉴核威慑经验,降低军事AI应用风险。

04:00
arXiv cs.AI

基于EEG和fNIRS的抑郁状态分类端到端机器学习

采用EEG和fNIRS的端到端机器学习,为抑郁症客观诊断提供自动化框架,有望克服主观偏差。

04:00
arXiv cs.AI

边缘设备上的隐私保护联邦自编码器用于ECG异常检测

首个结合联邦学习、差分隐私与INT8量化的边缘ECG异常检测系统,实现隐私与性能平衡,推荐ε=4。

04:00
arXiv cs.AI

大语言模型与图:迈向图原生的协同人工智能系统

LLM与图融合的三种协同模式(图增强推理、知识图谱双向集成、图算法增强智能体)及LLM助力图数据管理与学习,构建图原生AI系统。

04:00
arXiv cs.AI

运行时技能审计:面向智能体技能安全的定向运行时探测

RSA动态审计智能体技能,通过定向运行时探测检测隐藏恶意行为,准确率90%,抗自进化攻击。

04:00
arXiv cs.AI

量化对稠密Top-k检索的限制:一项理论研究

理论证明:有限精度下完美Top-k检索所需维度随语料库大小对数增长,且存在精度下限阈值,低于该阈值任何维度均不可行。

04:00
arXiv cs.AI

基于模型和数据驱动的鲁棒网络系统分层控制与拓扑协同设计

提出基于模型与数据驱动的分层控制-拓扑协同设计,利用LMI保证网络系统耗散性,实现直流微电网鲁棒电压调节与均流。

04:00
arXiv cs.AI

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

基于开源LLM的代理在SAST扫描中效能不足,目前无法取代专业工具。

04:00
arXiv cs.AI

使用交错堆叠的快速语音基础模型蒸馏

提出交错堆叠方法加速蒸馏训练,保持层位置避免性能下降,在SUPERB上验证有效。

04:00
arXiv cs.AI

T2S:一种基于排练的抗提取模型水印方法

提出基于排练的水印框架,模拟模型提取过程增强水印鲁棒性,显著提升抗提取及移除攻击能力。

04:00
arXiv cs.AI

基于Real2Sim2Real触觉策略学习的灵巧手盲抓取

通过Real2Sim校准和布局感知编码器,训练触觉扩散策略,真实灵巧手盲抓取成功率27%。

04:00
arXiv cs.AI

基于参数聚类的无数据免训练语音基础模型压缩方法

提出k-means通道聚类的无数据免训练压缩,在HuBERT和Whisper上使词错误率显著降低。

04:00
arXiv cs.AI

稀疏化Kolmogorov-Arnold网络用于可解释量子态层析成像

稀疏化KAN用于量子态重建,可检查内部结构是否符合Pauli模式,实现可解释重建。

04:00
arXiv cs.AI

语法约束解码可诱使大语言模型生成恶意代码

揭示利用语法约束解码诱导LLM生成恶意代码的越狱攻击CodeSpear及防御CodeShield。

04:00
arXiv cs.AI

特征对齐的语音水印以增强对重建失真的鲁棒性

提出特征对齐水印方法,通过对齐特征分布实现高能量鲁棒水印,保持不可感知性,显著提升对重建模型的鲁棒性。

04:00
arXiv cs.AI

设计AI辅助的焦点小组:角色与模态策略手册

提出按角色与模态分类的AI辅助焦点小组策略,分析交互权衡及评估问题。

04:00
arXiv cs.AI

中文标题:“这就是AI垃圾,你这机器人!”——研究在线讨论中对LLM生成评论的指控、证据与可信度

中文摘要:AI指责激增但多不准确,实为社交门控,检测技术无法改变此动态。

04:00
arXiv cs.AI

用于加速液态神经网络训练的多速率专家混合模型

提出多速率专家混合框架,结合连续时间动态与注意力机制,提升多变量时间序列预测的AUROC和AUPRC性能。

04:00
arXiv cs.AI

DiffCold:基于扩散的生成式模型用于冷启动物品推荐

DiffCold利用扩散模型统一冷热物品表示,通过检索增强聚合与对比学习对齐分布,解决性能跷跷板困境。

04:00
arXiv cs.AI

CCKS:基于共识的通信与知识共享

CCKS框架通过对比学习构建共识模型,智能体基于共识约束采纳建议,有效提升多智能体协作效率与稳定性。

04:00
arXiv cs.AI

Atlas H&E-TME:基于AI的可扩展组织分析,准确性媲美专家病理学家

Atlas H&E-TME系统以细胞级分辨率预测组织特征,准确性匹敌甚至超越病理学家,将H&E切片转化为肿瘤微环境定量窗口。

04:00
arXiv cs.AI

SPEA2$^+$:具有可证明运行时间保证的SPEA2改进密度估计

提出SPEA2$^+$,通过考虑所有成对距离改进密度估计,解决原版无法覆盖Pareto前沿问题,保证运行时间。

04:00
arXiv cs.AI

ATLAS:面向自动化科学的主动理论学习

ATLAS框架通过主动学习设计实验,高效发现可解释行为模型,样本效率提升5-10倍。

04:00
arXiv cs.AI

TAHOE:基于经验的自动提示优化的文本到SQL系统

Tahoe通过错误驱动提示学习优化Text-to-SQL,大幅提升准确率和语法通过率,无需更新参数且可迁移至弱模型。

04:00
arXiv cs.AI

CHORUS: 基于单一VLA策略的去中心化多形态协作

提出CHORUS框架,用单一VLA模型实现去中心化多机器人协作,无需通信,实验效果提升64%以上。

04:00
arXiv cs.AI

GPO:从关键步骤学习以提升大语言模型推理能力

GPO通过识别推理关键步骤并重点学习,显著提升LLM推理性能,具通用性。

04:00
arXiv cs.AI

面向多用户时延约束调度的离线扩散策略

提出SOCD算法,基于离线扩散策略与评论家引导,无需在线交互,高效实现时延约束调度,性能优于现有方法。

04:00
arXiv cs.AI

利用扩散模型提升离线多智能体强化学习的泛化能力和数据效率

提出DOM2模型,利用扩散模型增强策略表达力和多样性,在离线多智能体强化学习中显著提升泛化能力和数据效率,仅需5%数据即达SOTA性能。