EndoFSA:基于秩约束参数适配的内窥镜小样本图像生成
EndoFSA冻结预训练生成器,仅低秩更新少量参数以适配WCE小样本异常生成,合成图分类媲美真实图像。
OceanXL:基于分块划分与自适应剪枝的大规模水下3D高斯泼溅
OceanXL以分块划分与自适应剪枝实现可扩展的大规模水下3D高斯泼溅重建,兼顾高效与紧凑表示。
来自主动语音代理蜜罐的真实诈骗与骚扰电话对话语料库
主动语音蜜罐53天采集万通真实诈骗与骚扰通话,含895小时音频及逐轮转录,并验证真实性。
辅助学习的解析理论
基于师生框架推导在线SGD动力学方程,揭示辅助任务通过平衡优化驱动力与梯度噪声提升泛化能力。
NNV3:将神经网络验证拓展至新架构与新领域
NNV3发布:扩展星集支持新架构,新增概率可达性与公平性验证,覆盖图网络、视频等新领域基准。
并非所有混淆都一样:面向细粒度飞机检测的来源感知不确定性诊断
提出A²E²,将混淆按偶然/认知与类内/类间分解为四类可量化来源,用于细粒度飞机检测,并以针对性干预只减少可约混淆。
SwitchPFN:面向冻结式上下文时间序列分类的共享切换动力学
提出SwitchPFN,学习共享投影与码本,使时序动态特征跨样本可比,平均准确率相对提升4.47%。
CodeGraph:基于维基数据锚定的源代码开放分类法知识图谱
用代码大模型抽取语义实体并链接维基数据,构建含1.58亿节点、10亿边的源码开放分类知识图谱。
零数据自我博弈预训练
零数据自我博弈预训练:生成器与学习器协同搜索可计算结构,零样本损失随计算可预测扩展,并现上下文学习。
TopU-LBVS:面向基于配体虚拟筛选的真实多靶点基准
提出TopU-LBVS多靶点硬负样本基准,覆盖93靶标,揭示随机诱饵会高估LBVS性能。
口音类比引导:跨语言语音克隆中同等口音下更高的说话人相似度
提出免训练口音类比引导,减少参考口音泄漏,同等口音下提升说话人相似度,四个开源TTS模型有效。
将语言模型从视觉编码器中解放:语义序列化作为小语言模型的感知接口
冻结感知栈将场景序列化为文本供纯文本LLM作答,7B/3B超越同规模零样本VLM,监督下二者趋同。
MF-SCBO:多保真可扩展约束贝叶斯优化
提出MF-SCBO,将可扩展约束贝叶斯优化拓展至多保真,支持高维、黑箱约束与非嵌套采样,收敛更优。
PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露
PrivDrift基准:话题漂移后用户秘密仍可被探测恢复,千组对话泄露率38.7%–54.6%,属持续性行为失效。
基于姿态基础模型的运动攀岩免训练岩点使用检测
免训练,用冻结姿态基础模型指尖趾关键点检测攀岩岩点使用,F1达90.2%,优于基线。
AdaTex4D:面向4D高斯泼溅的自适应纹理容量分配
AdaTex4D为4D高斯泼溅按可见性梯度与形变尺度自适应分配纹理容量,纹理存储减半且质量保持,固定显存下更优并降低峰值内存。
HEXIS:将智能体技能编译为扩展有限状态机
将智能体技能编译为扩展有限状态机,分离知识与控制流,成功率平均提升16.1个百分点。
在自动语音识别中从未标注测试数据学习新词
提出ASR测试时从未标注数据学新词,以KL散度优化CTC候选拼写,OOV字符错误率最多降14.97%。
GHOST-Q:研究量化视觉语言模型中同分取舍下被忽视的视觉接地幻觉
量化视觉语言模型即使保持总分,仍会显著改变视觉接地成败,且省内存未必降延迟,需联合评估。
从图到馈线:约束引导的规则合规馈线生成
提出PG-DiGress,以约束引导扩散生成合规馈线,严格通过率从13.7%升至96.8%。
面向多年AADT估计的图上时空互补特征传播
提出时空互补特征传播框架,融合稀疏传感器与宏观交通模型,实现全网多年AADT估计,误差低于10%。
SciWalker:基于算子图与执行反馈合成科学编程问题
通过算子图采样与执行反馈合成科学编程题,构建8178题,经强化学习使SciCode子问题准确率提升9.9个百分点。
奖励倾斜的在线策略蒸馏:面向音频语言模型的声学依据
提出RT-OPD:用教师有无音频的对数概率差为奖励重塑分布,做反向KL蒸馏强化声学依据。
面向通用服务机器人的基于大模型链式任务规划的设计与评估
提出LLM链式两阶段架构,提示长度减约45%,各模型规划提升最高37个百分点,实机10任务完成6项。
服务前先筛选:面向1.4亿规模生产级客户体验AI智能体的仿真
用假设驱动仿真在部署前筛选CX智能体,仿真与生产评分高度相关,助力tNPS和自助率显著提升。
超越空间基准:从空间推理到导航
空间推理基准难直接提升导航;提出两阶段微调与空间先验蒸馏,8B模型低训耗超越多系统。
AERIAL:精度保持的低精度脑电解码器鲁棒性的对抗评估
BCI实验中,精度保持压缩不提升脑电解码器直接鲁棒性,但剪枝显著降低对抗迁移效率,三者相互独立。
当时间扰动类似传感器偏置:可穿戴活动识别器的无标签审计
无标签审计可穿戴 HAR:重放相位随机扰动,27 个模型准确率降 2.87–40.83 点,直流扰动破坏更大。
利用测试时增强提升黑盒放射学AI的校准
DualTTA:模型无关测试时增强框架,改善黑盒放射AI校准,肺栓塞与颅内出血误差降54%和43%。
个性化韩语唇读作为视觉语音识别:OLKAVS 上的迁移、统计与自适应
提出个性化韩语VSR系统,在OLKAVS上量化个体误差;低秩适配器以少量视频降低高错说话人CER并跨摄像头迁移。
残差相关性作为GP共区域化联合不确定性增益的诊断指标
共区域化主要提升联合不确定性而非点预测;残差相关性可预测该增益,据此提出诊断量与残差ICM方法。
GRASP:面向战略规划的智能体AI生成、修订与评估
GRASP是策略感知的多阶段规划框架,通过生成、修订、评估模块化协作,大幅提升复杂任务规划准确率并消除多任务性能退化。
皮层-小脑环路中误差与预测驱动的运动学习
提出小脑启发框架,融合多路预测与内部反馈,编码运动学与误差信号,实现延迟下在线校正并使适应提速十倍。
Ego-Exo4D 人体网格数据集:面向自我—他人视角采集的4D人体运动重建
Ego-Exo4D仅有稀疏3D姿态,本文提出大规模4D人体运动重建数据集Ego-Exo4D-HM及配套重建流程。
面向Roblox游戏搜索中多组件查询理解的搜索感知强化学习
提出蒸馏后强化学习框架,按组件用搜索实时反馈奖励优化查询理解,NDCG@20较SFT提升8.9。
基于免训练轨迹路由的视频扩散加速
TRACK通过校准比较大小模型的预测差异,将低差异步骤路由至小模型,无需训练即可加速视频扩散推理,最高提速2.7倍。
OmniFabric:面向三维服装重建的连贯UV空间纹理合成
OmniFabric在缝纫图案空间合成全局连贯纹理,用扩散Transformer在UV域精炼去伪影,生成可重光照的逼真3D服装。
追踪状态还是追踪陪集?学习到的状态追踪的代数解释
模型学群元素乘积时追踪陪集而非精确状态;部分精度由陪集大小决定,子群陪集结构揭示学习阶段与内部计算。
超越平均安全:机会约束的大语言模型微调
提出机会约束微调框架,限制安全样本退化比例,采用可微违规率替代与约束感知梯度下降,实验验证优于基线。
Jev-Mobile:以Jev作为移动GUI智能体的执行器
Jev-Mobile让VLM低频规划、Jev高频执行GUI动作,成功率79%,成本降73.4%。
ExplorationBench:衡量AI系统在可验证异世界中的探索能力
发布ExplorationBench基准:以规则可执行、与常识相悖的可验证异世界沙盒,评测AI能否通过探索获取并应用全新知识。
用可渲染程序进行多模态思维
SVGLM用SVG基元连接文本与图像推理,构建SVG图像编辑数据集,使VLM能"边想边画"。
WanPE:面向现代文本到视频生成的电影级提示增强
WanPE以397B参数、105万视频训练,实现电影级镜头规划,30秒视频人类偏好提升50.86分。
SAGE:通过拓扑引导缓解长时程推理偏差
SAGE以代数稀疏化和双曲结构引导缓解长时程推理偏差,多基准领先,Andrews-Curtis任务提升达8倍。
在扩散语言模型中实现近似联合采样
提出轻量采样器,使扩散语言模型单次全模型前向可近似联合采样多个词元,兼顾并行与精度,MAUVE达0.87。
人工智能在科学中的应用:早期洞察
多源数据显示:科学家广泛使用AI,其与专业模型互补,每周省约7小时,但瓶颈下移、验证需求激增。
电子健康记录信息检索的动态基准
提出可自动生成EHR问答的可持续基准BRIE,经19名临床医生验证,揭示LLM常遗漏关键临床信息。
TrackEverything:通过去重三维场景表示实现长时程稠密跟踪
提出TrackEverything,将视频表示为持久三维场景轨迹并去重,实现超千帧全点稠密三维跟踪,性能领先。
让训练引导选择:基于真实锚定效用的在线合成数据过滤
FROST以真实数据梯度反馈衡量合成数据效用,在线过滤约两至三成合成样本,在图像分类、文本转SQL与工业广告重排中均显著提升真实任务性能。
多模态大语言模型中的对齐幻觉
逐层视觉-文本相似度并非内容级对齐;受控干预揭示标量指标可被权重诱导,提出主角度间隙诊断,需任务证据校准。