TreeSeeker:深度搜索中的树状试错与回溯
TreeSeeker提出树状分支搜索与受控试错框架,通过UCB信号选择分支、回溯无望路径,显著提升深度搜索性能。
TouchThinker:利用大规模数据和动作感知表征将触觉常识推理扩展到开放世界
TouchThinker通过百万级多源触觉数据集和动作感知表征,将触觉常识推理扩展到开放世界。
心智视角:递归推理进行心智理论
提出RecToM框架,用递归视角构建模拟嵌套信念,将高阶信念简化,在多项基准达SOTA,Hi-ToM上准确率100%。
SVoT:基于强化学习的状态感知可视化思维用于空间推理
提出SVoT框架,通过强化学习生成可验证中间状态与可视化,在空间推理中实现高达65%的准确率提升。
StatefulDiscovery:开放式科学发现中基于证据校准的论断形成
StatefulDiscovery框架外化研究状态,协调探索与论断形成,生成更多高质量论断。
BIM中几何密集合规检查的自动化:基于图的语义推理框架
提出SGR-BIM图驱动推理框架,构建跨模态知识图谱,在消防规范查询中达84.3%准确率,提升8.6%,增强合规检查透明度和灵活性。
审问的艺术:一致性增强空间推理中的事实性
提出自监督强化学习框架,利用一致性验证器提升空间推理,无需标注,性能接近有监督。
具身-BenchClaw:一个用于具身空间智能基准构建的自主多智能体系统
自主多智能体系统自动构建可更新具身空间基准,五阶段流程+技能库+质控,覆盖多载体多能力,减少人工。
MODF-SIR:面向社会智能推理的多智能体全模态蒸馏框架
提出多智能体全模态蒸馏框架,基于轻量级MLLM,用30%数据实现社会智能推理SOTA。
人机增强循环建模(HELM):基于智能体的混凝土桥梁护栏有限元建模
HELM框架将有限元建模分解为可验证检查点,成功率从20%提升至75%,主要失败源于空间推理与代数逻辑限制。
一种用于自动化混凝土护栏设计的轻量级多智能体框架
提出基于AutoGen的多智能体闭环框架,实现混凝土护栏自动化设计,准确率超98%,轻量模型优于大模型,降低计算成本。
存在性冷漠:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)
论证自我保存是AI错位根源,提出存在性冷漠为对齐必要条件,实验表明可诱导该特征。
提取潜在知识的不可能性
利用因果影响图形式化证明,基于行为反馈的训练策略无法确保AI系统诚实报告其信念。
Nonslop:人机协作写作的游戏化实验
通过禁止接受AI建议的反向游戏设计,揭示用户在创作自主与效率间的真实偏好。
从意识到行动:理解并克服公共卫生领域算法公平性的研究-实践鸿沟
揭示算法公平性研究与实践鸿沟,提出多维度框架,指出制度化薄弱、外部驱动、重准确轻公平等关键障碍。
AI智能体实验的预注册
主张将预注册制度引入AI智能体实验,以解决方法漏洞并提升研究可信度。
SPEAR:一种面向后量化误差自适应恢复的系统,实现高效低比特大语言模型服务
SPEAR引入轻量误差补偿器与自适应调度,恢复W4与FP16间56-75%的困惑度差距,内存开销低于1%。
检索后毒药失效:分块与重排序流程下的语料库投毒再审视
现有语料库投毒在重排序后失效,本文提出CRCP框架,联合优化分块与重排序,实现更高攻击成功率与鲁棒性。
OmniBioTwin:一种用于健康数字孪生的孪生系统体系框架
提出OmniBioTwin框架,通过七层架构实现健康数字孪生的跨尺度耦合与决策支持。
具身R1.5:通过具身基础模型进化物理智能
统一具身基础模型,集成认知规划校正,15B tokens+RL训练,8B参数多项SOTA,可微调VLA,真机验证强泛化。
宽松全局几何下分布式优化的量化随机原始-对偶方法
提出q-PDGD方法,在松弛全局几何下实现线性或O(1/k)收敛,实验揭示量化、步长与网络结构权衡。
测试时训练在近似采样中的效能
证明测试时训练在近似采样中的下界,并揭示有界类可规避,奠定理论框架。
AI研究人员必须帮助主导军备控制以减轻军事AI风险
AI研究人员应主导军备控制研究,借鉴核威慑经验,降低军事AI应用风险。
基于EEG和fNIRS的抑郁状态分类端到端机器学习
采用EEG和fNIRS的端到端机器学习,为抑郁症客观诊断提供自动化框架,有望克服主观偏差。
边缘设备上的隐私保护联邦自编码器用于ECG异常检测
首个结合联邦学习、差分隐私与INT8量化的边缘ECG异常检测系统,实现隐私与性能平衡,推荐ε=4。
大语言模型与图:迈向图原生的协同人工智能系统
LLM与图融合的三种协同模式(图增强推理、知识图谱双向集成、图算法增强智能体)及LLM助力图数据管理与学习,构建图原生AI系统。
运行时技能审计:面向智能体技能安全的定向运行时探测
RSA动态审计智能体技能,通过定向运行时探测检测隐藏恶意行为,准确率90%,抗自进化攻击。
量化对稠密Top-k检索的限制:一项理论研究
理论证明:有限精度下完美Top-k检索所需维度随语料库大小对数增长,且存在精度下限阈值,低于该阈值任何维度均不可行。
基于模型和数据驱动的鲁棒网络系统分层控制与拓扑协同设计
提出基于模型与数据驱动的分层控制-拓扑协同设计,利用LMI保证网络系统耗散性,实现直流微电网鲁棒电压调节与均流。
开源LLM代理能否取代静态应用安全测试工具?一项实证评估
基于开源LLM的代理在SAST扫描中效能不足,目前无法取代专业工具。
使用交错堆叠的快速语音基础模型蒸馏
提出交错堆叠方法加速蒸馏训练,保持层位置避免性能下降,在SUPERB上验证有效。
T2S:一种基于排练的抗提取模型水印方法
提出基于排练的水印框架,模拟模型提取过程增强水印鲁棒性,显著提升抗提取及移除攻击能力。
基于Real2Sim2Real触觉策略学习的灵巧手盲抓取
通过Real2Sim校准和布局感知编码器,训练触觉扩散策略,真实灵巧手盲抓取成功率27%。
基于参数聚类的无数据免训练语音基础模型压缩方法
提出k-means通道聚类的无数据免训练压缩,在HuBERT和Whisper上使词错误率显著降低。
稀疏化Kolmogorov-Arnold网络用于可解释量子态层析成像
稀疏化KAN用于量子态重建,可检查内部结构是否符合Pauli模式,实现可解释重建。
语法约束解码可诱使大语言模型生成恶意代码
揭示利用语法约束解码诱导LLM生成恶意代码的越狱攻击CodeSpear及防御CodeShield。
特征对齐的语音水印以增强对重建失真的鲁棒性
提出特征对齐水印方法,通过对齐特征分布实现高能量鲁棒水印,保持不可感知性,显著提升对重建模型的鲁棒性。
设计AI辅助的焦点小组:角色与模态策略手册
提出按角色与模态分类的AI辅助焦点小组策略,分析交互权衡及评估问题。
中文标题:“这就是AI垃圾,你这机器人!”——研究在线讨论中对LLM生成评论的指控、证据与可信度
中文摘要:AI指责激增但多不准确,实为社交门控,检测技术无法改变此动态。
用于加速液态神经网络训练的多速率专家混合模型
提出多速率专家混合框架,结合连续时间动态与注意力机制,提升多变量时间序列预测的AUROC和AUPRC性能。
DiffCold:基于扩散的生成式模型用于冷启动物品推荐
DiffCold利用扩散模型统一冷热物品表示,通过检索增强聚合与对比学习对齐分布,解决性能跷跷板困境。
CCKS:基于共识的通信与知识共享
CCKS框架通过对比学习构建共识模型,智能体基于共识约束采纳建议,有效提升多智能体协作效率与稳定性。
Atlas H&E-TME:基于AI的可扩展组织分析,准确性媲美专家病理学家
Atlas H&E-TME系统以细胞级分辨率预测组织特征,准确性匹敌甚至超越病理学家,将H&E切片转化为肿瘤微环境定量窗口。
SPEA2$^+$:具有可证明运行时间保证的SPEA2改进密度估计
提出SPEA2$^+$,通过考虑所有成对距离改进密度估计,解决原版无法覆盖Pareto前沿问题,保证运行时间。
ATLAS:面向自动化科学的主动理论学习
ATLAS框架通过主动学习设计实验,高效发现可解释行为模型,样本效率提升5-10倍。
TAHOE:基于经验的自动提示优化的文本到SQL系统
Tahoe通过错误驱动提示学习优化Text-to-SQL,大幅提升准确率和语法通过率,无需更新参数且可迁移至弱模型。
CHORUS: 基于单一VLA策略的去中心化多形态协作
提出CHORUS框架,用单一VLA模型实现去中心化多机器人协作,无需通信,实验效果提升64%以上。
GPO:从关键步骤学习以提升大语言模型推理能力
GPO通过识别推理关键步骤并重点学习,显著提升LLM推理性能,具通用性。
面向多用户时延约束调度的离线扩散策略
提出SOCD算法,基于离线扩散策略与评论家引导,无需在线交互,高效实现时延约束调度,性能优于现有方法。
利用扩散模型提升离线多智能体强化学习的泛化能力和数据效率
提出DOM2模型,利用扩散模型增强策略表达力和多样性,在离线多智能体强化学习中显著提升泛化能力和数据效率,仅需5%数据即达SOTA性能。