辐射场引导预训练:利用无标签无线信号规模化定位模型
RFRP自监督预训练耦合定位大模型与射频辐射场,用无标签信号,定位误差降超40%。
用博弈论强化学习寻找接吻数
将接吻数问题转为合作矩阵补全博弈,用强化学习改进15个保持数十年的强界并发现新几何结构。
迈向教师与生成式人工智能的协同互动
提出教师—AI协作五层级框架,分析生成式AI对教师能力的替代、补充与增强,并展望二者协同决策。
从失败中学习:面向小型语言模型工具使用智能体的异构图记忆
提出FRESH,将历史成败构建为异构图经验,助小模型工具代理避错复用策略,提升可靠性与成功率。
冻结流会遗忘:诊断并恢复潜流世界模型中丢失的运动
冻结潜流世界模型虽稳定却丢失运动;DART以解码监督重训流,恢复运动并缩小差距,且发现像素误差奖励冻结预测。
PCQC:面向多轮医疗对话的特权反事实问题信用
PCQC利用特权患者信息构造反事实答案,为多轮医疗对话问题分配信用,提升诊断准确率并减少提问轮次。
强化学习始于强化学习之前:面向更优强化学习的同策略蒸馏
同策略蒸馏作为 RL 前置可提升最终表现,收益不只看初始精度;蒸馏目标需结合轨迹来源与后续训练选择。
预训练模型在新型AI辅助教育问题教学评估中的评价
评估预训练模型对AI辅助教育问题的布鲁姆分类;分布偏移下LLM优于ML和BERT,文本拼接与重训可提升。
RoomLight:面向室内环境的 2.5D 光照先验
提出面向室内环境的2.5D空间感知光照先验,联合建模HDR辐射与深度,提升光照恢复保真度。
压力下的报告:区分大语言模型统计分析中的事实性谄媚与语气性谄媚
提示框架改变大模型报告:批评框架致真效应遭过度怀疑,求显著框架致欠功效零结果过度自信;语气偏移更广。
Transformer 键值缓存的张量分解:谱结构与格式比较
比较Tucker/CP/TT/t-SVD:Tucker误差最低;词元/特征低秩,头/层近满秩,键值最优表示不同,后RoPE键可压缩性大降。
基于注意力掩码、潜变量锚定与精修的零样本物体移除
提出免训练零样本物体移除框架,融合注意力掩码、反演、潜变量锚定与局部精修,有效移除并保持背景一致。
面向混合专家模型的精确分位数均衡与负载误差注入
提出EQB精确全局分位数均衡与LEI负载误差注入,提升MoE全局与局部负载均衡及下游性能。
AnchorReasoning:面向长尾自动驾驶场景的视觉定位与因果推理数据集
41.6万帧视觉接地思维链数据集,以课程微调提升长尾自动驾驶定位推理与轨迹预测,且推理更快更省。
可验证的隐藏动力学博弈(VHD-Play):从已求解机制生成智能体强化学习环境
先求解数学模型再据此生成环境与评分,低成本产出3300个可验证智能体RL环境,训练大幅提升智能体能力。
面向作业车间调度的基于图神经网络强化学习的课程学习
用课程学习训练GNN强化学习求解作业车间调度,可缩短训练时间,30×30时最优性差距降约8.1–8.6个百分点。
置信度路由究竟在做什么:审计多智能体审议中的路由、校准与公开承诺
审计多智能体置信度路由:路由、校准、承诺须分开测量,校准改善不恢复区分度,路由与承诺随设定变化。
共享全局KV与层特定局部历史
共享全局KV时,保留层特定局部历史可降测试困惑度约1.4%,但缓存更大、长请求延迟更高。
基于高分辨率深度与超低分辨率RGB的隐私保护语义分割
结合高分辨率深度与超低分辨率RGB,提出隐私保护语义分割与2D到3D融合,ScanNet领先且零样本迁移。
BronchoTop:基于纯RGB拓扑定位的支气管镜导航
仅用RGB支气管镜视频,无需CT或外部传感器,即可实时拓扑定位导航,真实数据精度提升超20%。
LAYERSCOPE:视频与多模态学习表征的逐层刻画
提出无标签逐层分析框架LAYERSCOPE,以几何指标比较视频与多模态模型各层表征,发现中间层常优于末层。
面向政策约束型LLM医疗申诉生成的智能体治理与对抗验证
AGVF多智能体框架用于政策约束的医疗申诉生成,以对抗验证与引用门控消除违规、单调降低证据缺口。
RAMP:面向边缘CPU视觉模型的鲁棒自适应混合精度量化
评测13种敏感度指标,JS散度零灾难失效,配合K-Means聚类实现近无损量化,平均加速1.81倍。
Fed-ReMasker:特征级缺失下的联邦表格插补
将ReMasker用于联邦表格插补,使各中心借协作知识填补本地未观测特征;在特征级缺失基准中误差最低且鲁棒。
LightMIS:无需逐阶段解码器的超轻量级医学图像分割
提出无逐阶段解码器的超轻量医学图像分割网络LightMIS,仅0.131M参数,Dice达86.71%,可端侧部署。
基于语言模型的巴西YouTube十年气候极化研究
巴西YouTube十年24万条评论:模型检测气候立场,否认者少但跨立场争论多,共识者圈内强化。
高光谱基础模型用于高光谱解混的基准评测
系统评测高光谱基础模型解混性能,并比较特征上采样方法;简单上采样即可在四个数据集上达到领先效果。
大型知识模型:从论文到科学推理图景
提出大型知识模型,将论文转为可计算推理图谱,构建科学推理图景,显著提升科学检索与问答。
基于双编码器Transformer的卫星辐射数据行星边界层高度估计
提出双编码器Transformer,以掩码输入实现全天候行星边界层高度估计,MAE达155.8米,优于全部八种基线。
SWE-Universe:将真实世界可验证环境扩展至百万规模
提出SWE-Universe框架,用自训练模型从GitHub PR自动构建百万级可验证软件工程环境,助力编码智能体训练。
机制设计还不够:面向合作型AI的亲社会智能体
机制设计不足以最大化LLM智能体福利,不完全契约致福利损失;亲社会智能体可弥补缺口,实验证明有益。
PISCES:面向空间天气异常检测与预警的物理信息太阳风卷积自编码器
PISCES:物理约束太阳风卷积自编码器,无标签训练OMNI数据,分解异常贡献,可提前预警空间天气。
迈向 AI×DB 工作负载的高效编排
将AI操作融入数据库引擎,统一编排关系与AI算子,协同优化、调度与缓存复用,NeurEngine原型验证性能优势。
概率化且几何感知的刮削层等离子体模拟神经代理模型
提出概率化几何感知神经代理,将曲线网格展为图像张量,用条件流匹配捕捉多态并恢复分叉分支。
当纠缠为差异设定下界:审计与修复音频理解模型中的人口统计公平性
提出TRIAD审计框架与ORCA修复方法,揭示语音模型人口统计差异源于语音-语义纠缠,泄漏降低72%。
通过几何性质发现数据流形几何
反向直接学习交换性、时间一致性与共同参考等几何性质,用无监督目标恢复数据流形切空间和全局结构。
面向全双工语音到语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑
全双工语音对话易受不可感知对抗攻击;提出心理声学对齐潜空间平滑,无推理开销,增强鲁棒性且保持音质。
分隔符在增强 Vision Mamba 自回归预训练中的作用
提出STAR,用分隔符拼接多图扩展序列,增强Vision Mamba自回归预训练,提升鲁棒性与迁移性能。
预训练表征噪声线性探测中的谱过拟合
冻结预训练特征线性探测仍会谱过拟合噪声标签,中间PCA秩可恢复干净精度,宜作诊断。
看见想象之物:fMRI数据视觉想象解码中的潜在功能对齐
提出潜在功能对齐(LFA)方法,将想象脑活动映射到预训练感知解码器的语义条件空间,并引入神经检索增强,提升视觉想象解码性能。
面向视觉Transformer探测的动态证据路由学习
SSMProbe用Sinkhorn路由和S4解码器实现可审计ViT探针,以证据路径几何区分模型。
真金白银,虚假模型:影子API中的欺骗性模型声明
首次系统审计影子API,发现其与官方LLM行为不一致、身份验证失败,危害研究可复现性与用户利益。
以解释促学习(eX2L):面向分布偏移的对比视觉解释对正则化
提出eX2L,用对比解释对惩罚标签与混杂分类器相似性,去相关混杂特征并提升分布偏移泛化。
中文标题:面向在线线性规划的免重求解资源自适应随机梯度下降 中文摘要
提出RASGD,仅用单次请求与当前库存更新资源价格,无需重求解LP,期望遗憾O(log T)达到下界,计算高效。
对数深度循环语言建模
以平衡树递归算子实现自回归预测,用对数深度、线性时间建模语言,长度外推稳健,性能接近ALiBi Transformer。
PASTABench:面向智能体安全的序列轨迹主动评估
提出PASTABench基准,含1139条多轮轨迹并量化干预时机;最佳模型仅40.74%及时干预,揭示关键词过拟合。
用可微分高斯表示学习集体动力学
提出可微分高斯动力学DGD,用高斯混合、可微聚合与反馈递归从聚合计数学习群体动态,预测优于DeepAR。
Mizar:面向音频理解的1.59亿参数音频-语言模型
159M参数音频语言模型Mizar采用三阶段训练,在MMAU等基准超越同类,并支持CPU单机推理。
MultiVENT-Raw:原始视频检索与推理基准
发布MultiVENT-Raw多语言基准,含近12万原始视频、130事件与222查询,支持检索和生成,基线显示仍具挑战。
地理空间嵌入可检测原始林,但缓冲空间验证削弱其相较Sentinel特征的优势
地理空间嵌入可识别原始林,但缓冲空间验证下其较Sentinel特征的优势收窄,TESSERA无缓冲时最佳。