动作强制:通过恢复底层自运动基在无监督视频上训练世界模型
无需动作标注,用像素位移PCA恢复自运动基,为无监督视频生成可控世界模型训练信号,并评估。
当预条件指数转为负值时:学习率耦合与跨环境泛化
预条件指数与学习率耦合:最优指数随对数学习率近似线性下降;负指数提升跨环境鲁棒性,源验证偏好正指数。
通过认知实验范式探究智能体记忆中的稳定性—可塑性权衡
提出MemProbe框架,用四种认知实验范式诊断智能体记忆的稳定性—可塑性权衡,揭示系统行为差异。
思考的代价:测试时推理在LLM交易中能否带来回报?
多模型实验表明,增加推理投入并不能可靠提升扣除交易成本后的净收益,效果非单调且不稳定。
面向昂贵进化优化的排序可靠教师引导适应度近似:一项TinyML架构搜索研究
提出TGL-NSGA-II教师引导低精度评估框架,用于TinyML架构搜索:排序可靠,超体积最大,速度快2.2倍。
参数 vs. 上下文:面向鲁棒检索增强生成的 TRACE 微调
提出TRACE框架,用多智能体辩论轨迹与答案完整性正则,缓解知识冲突,提升RAG鲁棒性与答案质量。
BioEVAL:面向生物工程的全球多机构大型语言与多模态模型基准
22家研究组共建BioEVAL,以608项博士级题目评测生物工程多子领域推理,选择题最高准确率90%,领域差异显著。
StarWM:面向鲁棒世界模型的自监督训练注意力路由
StarWM自监督训练注意力路由决定重建区域,双流解码器隔离目标,动态干扰下性能最优并高保真保留状态
基于图网络学习粗步长动力学与内部力学响应
提出Newmark-β-DGN图网络框架,从粗步长轨迹推断未观测力学响应并支持长期预测。
MedTokenBudget:面向皮肤镜图像分类的病灶保留Token路由
提出MedTokenBudget有监督Token路由,用病灶掩码与LATS选Top-K,提升皮肤镜分类病灶保留率。
HARDEN:面向更难且答案不变的评估用例的约束进化搜索
约束进化搜索可将现有评测用例改写为更难但答案不变的变体,平均使模型准确率下降22.7%,最高达49.9%。
Benchy:迈向面向任务型 AI 基准测试的通用语言
Benchy 是面向任务型 AI 基准的语义语言与执行引擎,基准由程序、评分与数据集三元组定义。
打破同质化:面向创造性大模型输出的多样化人设集合
提出人设集合多样化方法,对比选择/生成与覆盖/前沿策略,在创意任务中提升输出多样性、原创性与创造力。
少思考,模拟更好:直觉提示提升LLM智能体模拟个体社交媒体反应,包括不熟悉内容
给大模型智能体态度信息并用直觉提示,比分析提示更能高保真模拟个体社交媒体反应,且可泛化至陌生话题。
面向视觉表征学习的条件预测充分统计量
提出条件预测充分统计量CPSS:用余弦损失预测下一图块嵌入,保留共享因子并丢弃噪声;实验揭示几何特性。
DanLing NestedTensor:面向深度学习的可组合多重不规则张量
提出 DanLing NestedTensor 张量抽象,使多轴不规则结构成为张量属性,免填充,兼容自动微分与编译,显著加速并降低显存。
分阶段深度训练:面向物理信息神经网络(PINNs)的表征课程
提出分阶段深度训练SDT:先训练浅层前缀并冻结,再加深度渐进精炼表征,多数基准误差明显降低。
中文标题:Atelier:通过超网络学习冷冻电镜体积数据的局部自监督特征
基于超网络摊销隐式表示拟合,从5439个冷冻电镜图谱自监督学习连续局部特征,提升八项体素级预测任务。
概念与组块的统一解释
概念与组块研究分离;本文提出统一计算理论并实现系统,以上下文无关文法验证其解析、生成与学习能力。
EviDETR:为时刻检索与高光检测保留查询相关的时间证据
EviDETR以特征重加权、Top-2专家解码与跨任务融合保留查询相关证据,提升时刻检索与高光检测性能。
音频大模型知道自己何时听不清你
音频大模型难以自判转录可靠性,但音频编码器表征可预测;轻量预测器据此提前请求澄清,宏F1达81%。
基于大语言模型的自动语音识别中的推理时目标说话人遗忘
提出TSU-ASR任务及轻量级ECG模块,可在推理时动态让指定说话人退出转写并标注其活动,保护隐私。
面向超高分辨率科学图像理解的结构引导掩码自编码器
提出SGMA,用四叉树分词与结构引导掩码处理千兆像素科学图像,多数据集超越MAE,推理提速24.8倍。
NeuralCert:极值数学构造的认证式计算发现
提出发现到认证框架,用神经网络学习变分函数并精确认证,在三个极值问题上实现严格数学发现与证明。
T-RoPE:用于序列推荐的时间感知旋转位置嵌入
提出时间感知旋转位置嵌入T-RoPE,用时间戳与多尺度频率打破平移不变性,在推荐基准和线上A/B显著提升。
基于检索的开放式评估在哪里失败?从长篇医学答案事实性验证中自动归纳分类体系
提出检索与验证两阶段失败分类,自动标注分析显示模型规模、推理与微调均无法解决,揭示该范式的根本局限。
LLM帕金森主义:执行控制失效、令牌低效的持续性,以及面向自主语言模型智能体的不确定性感知全局执行控制架构
LLM目标达成后仍持续低价值行动,源于生成与管控同环;GEC分离二者,成功率不变,令牌消耗降36.4%。
SAGE:基于频率均衡的源锚定引导,实现分层 RGB-T 对齐与融合
提出SAGE统一框架,融合频率均衡、分层对齐与子带融合,提升弱配准RGB-T对齐与融合性能。
Qwen3.5-0.8B 中关机响应的受防护梯度激活引导:最小步数策略
受门控的梯度激活引导可将部分关机回避改为接受,且不改变非关机决策,但效果小且高度选择性。
PALM:面向金融语言模型的时点适配
金融回测模型有前视偏差,无需逐年重训;PALM以低秩适配器拟合决策日前文本,冻结权重补充新时段知识。
CARGO:生产环境中智能体AI的上下文感知检索门控评估
CARGO将检索参考视为程序范例,以实例上下文判定事实,仅惩罚矛盾并按检索置信度门控,缓解参考实例分歧误判。
结合通用与领域特定前置任务的脑部磁共振图像分割
多任务自监督预训练联合通用图像修复和领域特定脑龄预测,提升多发性硬化、缺血性卒中及皮层分割表现。
基于对决反馈的成本感知最佳LLM识别
面向异构查询成本,提出对决反馈下成本感知最佳LLM识别算法,证明渐近最优成本,实验优于成本无关方法。
GAUDI:用于校准空气质量时间序列插补的几何感知扩散模型
块状缺失下采用几何感知条件扩散插补,在ItalyAir上RMSE达0.340,优于CSDI基线。
策略性自洽
不诚信提供商可利用自洽性策略重排额外推理路径,使多数投票看似必要,在多领域基准中超额收费并规避审计。
MM-VeriAgent:借助强化学习学会使用大量工具验证多模态虚假信息
面向混合来源多模态虚假信息,提出MM-VeriAgent,构建专用工具集,以强化学习训练代理调用工具,并用执行缓存提升效率。
TrafficImag:面向反事实路侧交通视频生成的基准
首个反事实路侧交通视频生成基准TrafficImag,按四维有效性评估,最佳模型端到端成功率55%。
给 BabyLM 喂通心粉:语码转换课程导致跨语言趋同
用LLM在英荷中语料插入词/句级语码转换预训练小模型,可对齐跨语言表示,课程学习提升BabyLM评测。
VLALight:面向应急感知交通信号控制的轻量级视觉-语言-动作模型
VLALight轻量端到端视觉-语言-动作模型,直接由路口观测与相位预测动作,应急等待降21.1%。
恰逢其时:面向基于大语言模型的同声语音到语音翻译的因果感知框架
提出面向基于大语言模型同声语音到语音翻译的因果感知框架,以FAST-CAP和数据管线提升质量并降低延迟。
REALMS:面向高维嵌套用户画像的实时精确受众规模测算AI助手对话系统
生产级对话式受众测算系统,以向量检索与LLM生成NL2SQL,实现千万级高维画像的秒级精确统计。
Inquesto Score:面向语音智能体的可靠性协议
提出Inquesto Score协议,以固定评测集中无功能故障达成目标的通话占比衡量语音智能体可靠性,显式定义故障等级并直测音频延迟。
难点在搜索之后:基于知识综合、组织与展示的网络智能体基准评测
提出KNOWS基准,评测浏览器智能体综合、组织与展示知识的开放式复杂任务;最佳智能体完整成功率不足3%,视觉理解与长程推理成瓶颈。
放大你所注视的:文本到图像生成中的目标显著性增强
提出目标显著性增强任务及GazeME框架,用可学习标记token直接提升生成图像中目标物体的视觉显著性。
从单目到双目:通过重投影与选择性修补加速双目高斯泼溅
主眼渲染重投影至副眼,缝隙插值,遮蔽区选择性重绘,复用alpha权重省去深度渲染,实现双目加速。
从弱数据到强策略:Q-目标实现可证明的上下文强化学习
提出QTPT,以Bellman式Q目标替代行为克隆,提升弱数据下上下文强化学习的鲁棒性并具理论保证。
ORCA:评估大语言模型在数据科学代码翻译中的表现
提出ORCA基准评测数据科学代码翻译,最强模型成功率仅56.92%与33.67%,意图增强法提升约5%。
利用扰动强度增强LLM解释中自洽性评估
提出LLM评判法统一量化扰动强度,受控比较各模型自洽性;输入扰动影响强于CoT,同类扰动方可公平比较。
基于通用复原先验的偏振图像复原学习
提出双分支一体化偏振复原框架,基于归一化Stokes表示,借通用复原先验与专家混合,并建复合退化基准。
TRACE:流式视频理解的时间审计与条件感知评估
提出TRACE基准,显式考量证据时序与触发条件,多维评估流式视频理解,揭示相同准确率下的行为差异。