智能体出版协议:科学出版现代化的一次尝试
提出智能体出版协议(APP),将论文与代码、数据打包,通过可执行智能体实现成果复现与扩展。
GRAFT:拟南芥中关联基因表达与表型性状预测的生物图与超图基准
提出拟南芥多模态数据集GRAFT,关联基因表达与表型性状,支持预测与图学习基准。
面向资源自适应LLM推理的端到端动态稀疏性
L2A框架实现资源自适应的LLM推理,动态跳过层、剪枝头、减少推理令牌,单一模型覆盖计算-精度帕累托前沿。
SceneBot:接触提示的通用人形全身追踪与场景交互
SceneBot统一自由空间与接触交互的全身追踪,以接触标签引导策略,泛化执行搬箱上楼等复杂任务,代码开源。
RS-Diffuser:具有分布价值指导的风险敏感扩散规划
RS-Diffuser通过尾部风险梯度引导扩散规划,灵活实现风险规避、中性或寻求行为,提升离线RL鲁棒性与安全性。
从通用音频标记到空间声音事件定位与检测
提出AT2SELD框架,利用预训练通用音频标记模型扩展至空间定位与检测,通过神经架构搜索优化,验证其有效性。
先丢弃再恢复:视觉-语言-动作模型的冗余程度探究
VLA模型中语言骨干高度冗余,移除一半甚至保留两层LLM块不影响性能,而视觉和动作路径不可或缺。
针对高性能计算系统上可扩展知识蒸馏的师生划分优化
通过解耦师生模型划分与拓扑感知并行,吞吐量提升67%,加速GKD训练。
SpatialUAV:低空无人机空间智能基准测试
提出含4331实例、14类任务的低空无人机空间智能基准,揭示模型在跨视角关联与几何推理上的瓶颈。
用于流量矩阵预测的参数高效量子启发式快速权重编程器
提出量子启发式G-QKANFWP模型,以22.4%参数超越较大LSTM,实现资源受限下更优的流量矩阵预测。
S$^2$-VLA:状态空间引导的视觉-语言-动作模型用于长程操作
提出S²-VLA,通过状态空间引导自适应注意力动态融合视觉、意图与动作,在长程操作中超越7B模型,实现最优性能。
MLVC: 面向实际部署的多平台学习型视频编解码器
MLVC通过超先验传输尺度参数确保跨平台熵编码一致,架构改进与感知训练恢复效率,在NPU上实时运行,兼顾性能与鲁棒性,适合实际部署。
Reflect-R1:基于证据驱动的长视频理解自纠正反思
提出证据驱动自纠正框架Reflect-R1,通过动态检索视觉证据和阶段解耦强化学习,实现长视频理解的真正自我纠正。
全程步数:基于视频的帕金森转身步数计数
提出基于视频的粗到细步数计数方法,融合3D网格与光流捕捉步态,用多实例学习预测残差,超越现有方法。
Home3D 1.0:面向室内设计的高保真图像到3D资产生成系统
从单张图像生成带PBR材质的3D资产,可分解为材质组件,含几何、纹理、材质、部件四模块。
超越预测的推理:从数据驱动到因果软件工程
呼吁从数据驱动转向因果推理,实现人机协作以增强工程师的智能支持。
STAG:面向微表情识别的动作单元时空演化结构表示
STAG网络通过动态ROI-AU耦合与双分支架构,联合建模运动流和面部连接,提升微表情识别鲁棒性与泛化性。
OSOR:面向效果感知对象移除的单步扩散修补
提出OSOR单步扩散模型,实现效果感知与面具鲁棒的对象移除,推理快4-30倍,性能超越多步基线。
越狱攻击下的鲁棒有害特征:来自大型语言模型注意力头专门化的机制证据
越狱攻击选择性抑制早期注意力头,但中层安全头保持激活,形成鲁棒有害特征,可被无训练读取用于检测。
在流匹配中,曝光偏差可通过方向与频率修正自我缓解
提出DEFAR框架,利用偏差自身的方向与频率信号实现自适应修正,显著提升生成性能。
治理仓库,而非代理:衡量AI原生软件中的生态系统级风险
AI编码代理集成风险源于代码仓库生态,约一半摩擦变异归因于仓库,应转向生态系统级治理。
HAT-4D: 通过人机协作从单目视频中提取4D多物体交互
HAT-4D:首个从单目视频重建多物体4D交互的框架,结合VLM与人类反馈解决遮挡,实现物理合理重建并创建基准。
智能体情节控制
AEC融合LLM与情节强化学习,通过语义增强和关键状态识别,数据效率提升2-6倍,实现强泛化。
面向自动规划的对称感知Transformer训练
提出对称感知对比学习训练Transformer,解决变量名对称性导致的组合爆炸,提升自动规划性能。
PreferThinker:基于推理的个性化图像偏好评估
提出推理式个性化图像偏好评估框架,通过预测偏好画像和两阶段训练实现可解释多维评分。
基于Transformer的慢性肾病预后预测
基于Transformer模型利用电子健康记录预测慢性肾病进展,准确率高,助力个性化治疗。
SciFig:面向科学论文的可编辑图表自动化生成
SciFig多智能体框架从科学文本自动生成可编辑图表,性能领先,约10分钟完成。
离线博弈论多智能体强化学习中的保守均衡发现
通过量化博弈不确定性并修改强化学习目标,提出COffeE-PSRO方法,在离线设置中发现低遗憾均衡解。
CausalFlip:超越语义匹配的大语言模型因果判断基准
CausalFlip基准通过语义相似但因果相反的问题检验LLM,发现显式思维链仍被误导,内化推理更优。
生成式AI时代的深度伪造媒体生成与检测:综述与展望
综述深度伪造生成与检测技术,构建分类法与排行榜,新基准表明先进检测器无法泛化至未知生成器。
转向开放与可复现的AI研究
2014至2024年AI论文可复现性从28%升至64%,代码数据共享增近六倍,改进先于检查表,反映开放科学趋势。
针对完全可观测非确定性问题的状态安全性判定算法:技术报告
提出iPI算法,兼具TarjanSafe最佳运行时与多项式最坏情况保证,在不适问题中扩展性显著提升。
iCost:一种新颖的基于实例复杂度的代价敏感学习框架
iCost框架根据少数类样本的学习难度自适应分配惩罚,提升分类性能,优于传统代价敏感学习和重采样方法。
条件因果赌博机的最小搜索空间
提出最优条件干预最小节点集的图特征,设计O(|V|+|E|)算法,剪枝搜索空间并加速收敛。
DMind基准:面向Web3领域LLM能力的全面评估
DMind基准全面评估Web3领域LLM能力,揭示其在安全审计等高推理任务中存在显著弱点。
跨域多智能体LLM系统必须解决的七大安全挑战
提出跨域多智能体LLM系统的七大安全挑战,涵盖攻击示例、评估指标与研究指南。
先排序后服务:通过成对学习排序实现低延迟LLM服务
PARS调度器通过成对排序近似最短作业优先,减少头部阻塞,延迟降低15.7倍且跨模型通用。
Trust Region Masking for Long-Horizon LLM Reinforcement Learning
中文标题:深度强化学习中SO(3)动作表示入门
摘要:系统评估SO(3)动作表示对强化学习的影响,发现局部切向量表示最可靠,提供实用选择指南。
加速MRI重建的像素级不确定性量化
提出无需真实参考图像的像素级不确定性量化框架,自动识别不可靠区域,与重建误差高度相关。
DDSA:面向对抗鲁棒性测试时空效率的双域策略攻击
提出DDSA双域策略攻击,通过时间选择性和空间精度优化对抗测试资源效率。
基于算子推断与重叠Schwarz交替法的混合耦合
提出混合方法,通过重叠Schwarz交替法耦合算子推断降阶模型与高保真模型,三维固体动力学加速达106倍。
中文标题:面向代理基础设施的代理分析:一种基于LLM的DAO与企业AI协议治理比较管道
中文摘要:提出LLM驱动的比较分析管道,研究DAO与公司AI协议治理,发现开放治理促进主题趋同但参与不平等相似。
我们在多模态大语言模型评估中遗漏了什么?
现有评估局限于孤立任务,缺乏时空一致性、物理理解等维度,需填补空白以衡量真实进展。
加速回报与科学定性引擎
加速回报理论无法解决科学发现核心问题,定性推理才是关键,人类智慧值得保存。
指令泄漏:提示组合式智能体系统中的跨模块干扰
提示组合智能体中编辑一个模块会无声改变其他行为(组合行为泄漏),源于自注意力无边界,需评估跨模块干扰。
OpenFinGym:一个用于评估量化智能体的可验证多任务Gym环境
OpenFinGym是统一的多任务量化金融环境,可自动构建任务并防止数据泄露,支持后训练评估。
几何感知MCTS在组合几何极值问题中的应用
提出几何感知MCTS框架,利用几何约束与对称性,在多个组合几何极值问题上取得新最佳结果。
当智能体遇上电动公交车队运营:聚合商框架中的定价行为、权衡与政策启示
智能体聚合商框架可优化电动公交调度与电网协同,但利润导向定价会抽取运营商价值,需透明协调规则。
基于格论的无偏规范集值预言机
用格论不动点定理解决预言机自指问题,得到无偏自洽的规范集值答案。