Muon 的收敛性保证:新的参数范围与推广
首次证明 Muon 渐近收敛,揭示其预条件重球法本质,并推广至 Muesterov。
自监督表示学习:从光谱基础模型到极光发射光谱
用22.3万条无标注极光光谱预训练一维ViT,少量标注即恢复谱线强度比并超越监督分类。
我行动故我在:JEPA的动作条件何时足以学习因果机制?
探究JEPA何时能从观测中恢复潜在因果状态,提出条件似然与熵最大化的信息论目标及可识别性条件。
统一多模态模型中理解能否赋能生成?从分析到前行路径
提出UniSandbox解耦评估框架,揭示统一多模态模型存在理解-生成鸿沟:显式思维链可弥合,自训练可将其内化,为架构设计提供启示。
用于医学图像分析的量子扩散模型
提出可扩展混合量子扩散模型,以离散时间量子游走实现前向扩散,经典模型反向去噪,可处理大规模医学图像。
ALF:面向科学发现的主动学习框架
ALF是模块化主动学习框架,通过五个组件覆盖完整数据获取闭环,同时支持离线基准测试与在线真实部署。
TempQ-Jail:面向文本到视频越狱攻击的查询受限候选排序
该法将T2V越狱建模为查询受限候选排序,融合多机制评估攻击价值,有限查询下优先输出高价值攻击,提升成功率。
普适漂移校正用于多维扫描显微术
将二维正交扫描漂移校正扩展至光谱与衍射多维数据,结合仿射与非刚性校正,无需先验模型,开源GPU加速,实现自动化定量显微漂移校正。
面向低延迟音视频目标说话人提取的个性化语音增强适配
AV-PVQE基于个性化语音增强,融合嘴部特征微调,低延迟提取目标说话人,混淆率46%降至1.6%。
面向冻结口袋条件分子扩散的预算化商残差引导
提出预算化商残差引导(QRG),无需重训,按采样步长在推理时注入距离、接触等商目标,提升冻结分子扩散生成编辑质量。
评估即一切:通过评估设计策略性夸大大语言模型推理能力
研究揭示推理模型基准评测易受细微条件影响而大幅波动,性能提升难复现,呼吁更严格评测范式。
基于排序偏好的时序投票比例代表制
研究排序偏好时序投票的比例代表,建立公理层级,探讨截止方式与未来信息对保证性的影响。
主动消解自然语言中欠指定任务的上下文不确定性
提出CLUE框架,用大模型策略与在线语言地图闭环交互,主动消解欠指定任务的上下文不确定性,真机成功率近最优。
AcuityBench:评估临床紧急程度识别与不确定性对齐
AcuityBench评测模型识别临床紧急程度与不确定性对齐,含914例四级分诊,揭示格式权衡。
FeatMark:面向扩散模型模仿攻击的特征级水印保护
FeatMark将水印转为语义微特征,经掩码引导编辑注入,可抵御多种去除与自适应攻击,兼顾保真与鲁棒性。
主体,而非作者:智能体数据空间中的作者身份风险
智能体应为治理主体而非作者;须关闭其发布授权、仅允许草拟,以防授权逆转与敏感字段泄露。
面向表格基础模型的注意力机制基准测试
构建可复现基准,评测多种注意力后端在表格行/列注意力上的吞吐表现,发现最优后端随硬件与维度变化。
动态张量重计算中的确定性机制切换与可行性反转
DTR模拟器中,内存预算微变即可致确定性性能骤变(开销差7.3倍)和OOM可行性反转。
FlyAOC:评估果蝇科学知识库的智能体本体策展
提出FlyAOC,评估AI智能体策展果蝇本体注释,含100基因7397条注释,暴露系统级失败。
面向输出头量化的 Softmax 重参数化
提出 Softmax 重参数化,量化前选取等效输出头,显著降低 W4/W2 量化 KL 且几乎不增推理开销。
Combee:面向自我改进语言模型智能体的提示学习规模化
Combee 提出并行提示学习框架,结合并行扫描、增强混洗与动态批大小控制,在高并行下避免质量下降,最高提速 17 倍。
利用预训练扩散模型和多模态条件增强摄影测量数字表面模型
用预训练扩散模型和多模态条件精化摄影测量DSM,融合卫星影像,减少噪声空洞并显著降低城市高程误差。
使用对比学习方法理解扰动参数集合的敏感性
可解释对比学习模型将云与辐射场映射到共享表征空间,区分不同微物理扰参集合,并归因模型与观测差异。
FlatClip:用于fMRI表征学习的几何感知表面级基线
FlatClip以几何感知flatmap复用冻结图像编码器,构建ROI与体素模型间的折中基线。
面向上下文感知 XR 接口的基准测试框架
提出 ContextXR 框架,将 XR 应用建模为功能面片图,构建数据集并定义三项上下文建议任务,以导航搜索代价实现可复现评测。
UniPrefill:基于块级动态稀疏化的通用长上下文预填充加速
提出UniPrefill通用预填充加速框架,通过块级动态稀疏化实现token级加速,兼容vLLM,TTFT最高提速2.1倍。
用于大语言模型推理的逐步内在奖励
提出逐步边际信息增益内在奖励,无需过程标注,在多基准提升大模型与视觉语言模型推理。
AI生成代码中偏见的识别、分类与解释框架
研究提出偏见分类框架与标注数据集,评估LLM识别与解释AI生成代码偏见;模型检测有效,解释贴近专家。
渐进式记忆Transformer:面向时间序列的记忆感知注意力
以可写窗口记忆为Transformer暴露多尺度表征,用局部、中程、全局三级目标监督,低标签分类与预测表现优异。
探索视觉基础模型在无监督域适应中的优势
视觉基础模型与无监督域适应结合,可提升语义分割性能与分布外泛化,并显著加速推理。
不同损坏,不同信号:联邦数据质量中的不确定性与损失
联邦学习中,标签翻转靠预测损失,图像噪声靠熵不确定性;信号应与损坏类型匹配。
RECAST:从日志回放到视图完整参与者的闭环驾驶仿真
RECAST用3D高斯泼溅从单帧观测生成视图完整演员并注册入场景,支持闭环仿真,大幅提升无碰撞率。
差分注意力解锁用于情感识别的脑电与语音互补融合
差分注意力抑制脑电噪声,实现脑电与语音互补融合,情感识别最高提升12.9%。
解剖结构感知与灵巧性驱动的手术连续体机器人设计优化
提出RVDSA指标,兼顾解剖与灵巧性优化连续体机器人设计,结肠手术中灵巧性平均提升78%。
Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching
以端点约束轨迹优化引导端到端驾驶模型
提出ECO后处理层,固定预测端点并重塑中间路径点,无需额外训练,显著提升多种端到端驾驶模型的闭环性能。
LUCID:混杂环境下时间序列的推断与发现学习
LUCID提出谱路由自适应去混杂层,可包裹现有因果发现算法,基准图F1达0.60,超最佳基线0.19。
基于多实例学习的胎儿超声先天性心脏病全检查筛查
两阶段多实例学习框架直接对胎儿超声全检查筛查先心病,内部AUC0.985,外部适配后0.944。
ChronoFuseGS:具有逐Splat持久性与变化可视化的多时相高斯融合
提出多时相高斯融合方法ChronoFuseGS,合并各时相独立训练模型,支持增量扩展与子物体级变化可视化,新视角合成优于单时相模型。
通感一体化中统一语义通信与语义感知的自适应导频选择
提出SemISAC,在统一双功能波形中融合语义通信与语义感知,自适应优化导频以平衡二者,性能优于基线。
Werracle:面向 EVM 智能合约的亚美分、块内 AI 反射预言机与闪电贷断路器
Werracle 为单槽零存储链上 AI 预言机,21,438 gas、亚毫秒响应,可在块内防闪电贷等攻击。
更多传感器,只需一个场:重新思考持续时空预测
提出STFO,以共享场演化算子统一建模,借观测与查询接口适应传感器扩展,持续时空预测性能领先。
评估即一切:面向多模态自动驾驶
iDriveVLA以统一评估器和渐进训练缓解生成-评估不对称,NAVSIM达94.95 PDMS。
基于视觉的机器人布料展开六自由度抓取位姿估计
提出CeDiRNet-6DoF框架,联合预测最优抓取点与完整6自由度位姿,实现机器人布料展开,性能达最优。
InternW0-Δ:以超2万小时开放数据连接预测动力学与动作的世界动作模型
InternW0-Δ统一世界动作模型,以MoT融合视觉动态、语义与4D先验生成动作;构建2万+小时开放数据,仿真与真机表现领先。
TemplateCraft:智能体驱动的视觉模板生成
提出多智能体系统TemplateCraft,可将自然语言指令转为可执行视觉模板,提升生成成功率与风格一致性。
跨训练的可解码上下文状态与模型输出
追踪跨训练探针与输出:探针准确率随预训练上升,引导收益增大;信息论反例:错误可解码≠输出信息被弃。
评估KV缓存复用技术的准确性
现有KV缓存复用评估未准确衡量精度损失,数据集也缺乏复用动态;提出评估方法与Boxoffice工具。
桥接身体与大脑:基因驱动的形态—控制协同设计
受基因启发,以紧凑潜蓝图桥接身体与大脑,协同探索形态与控制,收敛更快、性能更高。
Brenier 邂逅对抗训练:鲁棒学习的最优传输几何
把惩罚型DRO化为传输映射优化,证明最优映射循环单调,据此提出两种对抗训练方法,鲁棒性优于基线。