AutoMatBench:用于加速材料性能预测基准测试的自动化优化工具包
提出AutoMatBench,自动优化配置,12步内达MatBench效果,成本减半,助力新材料发现。
面向能源领域大语言模型应用的多模态数据集
提出 mAIEnergy 多模态数据集,整合海量文本、图像、时序及地理数据,支持能源领域大语言模型应用,遵循 FAIR 原则。
像机器人一样看:面向视觉-语言-动作模型的以机器人为中心的点图
提出机器人中心点图,解决VLA模型观测与动作坐标系不一致,提升跨视角泛化能力。
代理探索与可复用引导:一种通过代理引导更新信号的模块化LLM后训练范式
提出PUST框架,用轻量代理探索高奖励行为,提取相对改进信号转移给主模型,实现解耦、可复用、跨模型迁移的高效后训练。
CDFM:迈向通用因果发现基础模型
提出通用因果发现基础模型CDFM,基于变分框架和大规模预训练,实现零样本因果结构推断,性能超越传统算法。
借助人工智能实现包容肢体差异的头像设计
AI可克服数据稀缺与动画限制,推动包容肢体差异的3D头像设计。
Vinci2:在连续自我中心视频中提供主动辅助
Vinci2通过记忆增强代理实现上下文驱动的主动辅助,并构建EgoServe基准和EgoMemo模型。
具有摘要记忆的可解释智能体对话诈骗检测系统
提出可解释智能体系统检测对话诈骗,准确率97.8%,用户信任和信心显著提升。
闭环:物联网自动化异常驱动网络撤销的访问控制架构
提出闭环架构,用标准协议自动撤销异常IoT设备,AUC达0.9964,断开平均335.8ms,撤销111.5ms。
关于CVPR 2026@AdvML研讨会挑战的技术报告
针对自动驾驶VLA的对抗多模态攻击挑战,发现图像攻击、多视图优化等五大关键模式。
通过交替约束优化的结构-特征对齐图学习
提出约束双视图框架,交替优化对齐GNN嵌入与特征先验,CSAG-GNN动态路由,提升结构鲁棒性。
DiffEEG:一种用于学习脑电图通用表征的自监督去噪扩散模型
DiffEEG通过扩散预训练和强化学习微调,在极不平衡的EEG癫痫检测中实现高准确率和F1分数。
智能体攻防:面向生产环境智能体的自动化红队研究
提出AHA框架,通过漏洞假设与反证循环发现可复用漏洞知识,红队性能提升14.2%,可跨场景迁移。
主动式离线到在线强化学习
提出主动策略选择方法,平衡评估与微调,基于上置信界分配交互预算,显著提升有限交互下的性能。
一个极简的重定向引导的强化学习方案用于灵巧操作
REGRIND方法从单个人类演示学习灵巧操作策略,通过重定向和残差RL实现零样本迁移到真实硬件。
MM-ToolSandBox:评估视觉工具调用代理的统一框架
提出视觉工具调用评估框架,覆盖500+工具和16领域,测试12个模型最好成功率不足50%,主要瓶颈在视觉精度。
大型音频-语言模型中用于声学感知的编码器侧神经元识别与放大
IAAN无需训练,通过识别并放大编码器声学神经元,在非语义语音属性上平均提升25.7%准确率,证明编码器内神经元级干预有效。
KV-PRM:通过KV缓存传递实现多智能体测试时扩展的高效过程奖励建模
KV-PRM通过直接读取生成阶段的KV缓存,将评分成本从O(L²)降至O(L),性能持平或超越文本PRM,计算开销减少数千倍。
Vlasov方程平均场推导的形式化:AI辅助Lean形式化作为策略游戏
AI辅助Lean形式化Vlasov方程的Dobrushin平均场推导,实现完整无漏洞证明,并分离出可复用最优传输层。
L-MAD:法律推理中多智能体辩论结构的系统性评估
L-MAD框架评估法律辩论结构,提升准确度8%,但增加讨论轮次会导致错误强化,界定了协作系统的安全边界。
MedRealMM:面向中文在线医疗咨询的真实世界多模态基准
基于真实医患对话构建多模态基准,评估19个模型,发现当前模型在安全避免错误方面仍存在瓶颈。
神经-代理控制:一种基于深度学习的LLM驱动代理AI框架用于安全控制管理
提出神经-代理框架,结合LLM与时间序列基础模型,通过反事实物理注入杜绝幻觉,实现工业物联网零无效动作自主防御。
分布偏移下可靠的长程代理上下文演化的范围验证
GRACE利用类型语义图维护指令并局部验证更新,将严格可靠性从0.091提升至0.673,优于平文基线。
LongMedBench:面向长期临床决策的医疗智能体基准测试
提出LongMedBench,基于电子病历评估医疗智能体长期决策能力,含事实问答、时间推理与决策任务,发现模型隐式时间推理弱且决策依赖上下文。
虚构世界构建:基于多智能体LLM协作的分层上下文压缩与迭代审查
多智能体系统通过90%令牌压缩及迭代审查将提案通过率提升至85%以上,高效生成自洽虚构世界,实现零冲突交付。
贝叶斯因果发现是如何失败的?潜在混淆下线性高斯网络中结构后果的特征化
分析潜在混淆下贝叶斯因果发现的后验失效:推导临界阈值,样本量越大越易出现虚假边,区分两种失效模式。
这不是一只烟斗:AI系统作为语义抽象
AI系统输出并非事实,而是人工表征。我们提出语义框架区分知识、来源与系统可用信息,以定义外推、断言错误等常见失败。
ConceptSMILE:审计基于概念的可解释人工智能的可信度
ConceptSMILE通过扰动输入评估概念解释可靠性,发现不同路径可靠性存在差异。
TrustX智能体风险分类框架(ARC):对内部创建的自主AI系统进行风险分级
提出ARC框架,通过12维评分和三级治理输出,对内部自主AI系统进行风险分级。
Agora:通过基于拍卖的任务分配增强LLM智能体推理
Agora框架利用激励相容拍卖动态分配任务,矫正模型出价,提升推理质量与成本效率。
大语言模型驱动的多目标贝叶斯优化算法进化生成
LLM进化生成多目标贝叶斯优化算法,合成与工程问题中超体积更高、耗时更低,超越手动设计。
REFORGE:一种在反编译二进制函数命名中对大语言模型逆向工程能力进行基准测试的方法
REFORGE提出不确定性感知的基准测试方法,揭示编译器优化导致二进制-源码对齐可靠性下降,并纠正幸存者偏差。
CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配
CLAP方法用语言-动作因果预测直接转换VLM为VLA,2B模型在LIBERO达90.8%准确率,并提升鲁棒性。
多条件扩散合成沙沸用于低资源土堤坝检测
基于扩散模型和ControlNet生成沙沸合成图像,解决低资源下像素级检测标注稀缺问题。
LLM生成代码中的拼凑问题
LLM代码局部正确但全局不一致,称为拼凑问题,需专用框架验证。
技能市场内幕:从软件工程活动到可复用的智能体技能
首次实证发现:软件工程活动正通过技能市场转为可复用智能体技能,启示技能推荐与工程化重构等研究方向。
一种评估医疗AI模型中部分观测数据充足性的个性化计算框架
个性化FSA框架评估部分观测数据是否足以达到全特征预测性能,助力医疗AI部署。
关注细节:评估vLLM配置中的能源、性能和准确性权衡
研究vLLM配置对能源、性能和准确性的影响,发现效果高度依赖模型和工作负载,无通用最优配置。
触觉与视觉双重条件约束下的全臂操作接触中心控制
融合触觉视觉与接触雅可比,实现接触中心MPC,在多接触任务中性能领先。
面向电信/物联网欺诈控制请求的区块链关联可审计决策管理
QLoRA微调LLM优于零样本,但不如低成本集中式集成,其中M1(集中式ML)平衡最佳。
风险感知的一般效用马尔可夫决策过程
提出风险感知GUMDPs,用熵风险度量,经MCTS在线规划求解,实验验证优化风险行为。
多样性验证:当任务等价程序的验证性不同时
任务等价程序验证性差异大,多样性实现可提升验证成功率至67.1%。
所有解释都是错的,但很多是有用的:使用大语言模型探索罗生门解释集
提出罗生门解释集,用大语言模型迭代对齐解释与预测,同时提升准确率和解释质量。
十年视觉语言AI模型的准确性与视觉认知错误演变
通过CSB数据集评估十年VLM模型,发现MLLMs消除了准确率差距和多数错误类型,但空间依赖误差仍存在。
基于基数约束的大规模投资组合优化问题与增强型多目标进化算法
通过新表示、算子和修复机制增强多目标进化算法,实现基数约束下更快收敛和广泛搜索,性能不降。
PAC-ACT:面向动作分块变换器的后训练Actor-Critic
提出PAC-ACT后训练框架,对动作分块变换器进行强化学习微调,提升工业接触任务成功率和力安全性,峰值力降低46倍。
通过BREW框架改进语言代理:从经验中引导学习的环境知识引导
BREW框架将代理交互轨迹蒸馏为知识库,通过EG-MCTS算法优化,在三个基准上提升10-20%成功率并减少10-15%执行步数。
走向可关闭智能体:强化学习智能体与大语言模型中随机选择的泛化
DReST奖励函数让智能体在轨迹长度上保持中性且有用,实验证明其泛化性并显著降低干扰关闭行为。
PHINN-EEG:梦境状态脑电图的拓扑时间序列分析——用于梦境内容分类的动态贝蒂曲线与拓扑条件神经信号合成
提出PHINN-EEG拓扑框架,用动态贝蒂曲线分析梦境脑电,目标AUC 0.82-0.90,并实现拓扑条件神经信号合成。
超越嵌入:面向二进制代码相似性的可解释特征提取
基于语言模型代理生成可解释特征,无需训练即可匹配嵌入方法性能,结合后显著更优,实现准确性、可扩展性与可解释性共存。