RoPE已死,RoPE万岁:迈向可扩展的数据感知位置编码
提出DaRoPE:慢频段用数据学习有界坐标替代绝对位置,缓解近因偏差,非文本领先,语言建模与外推持平。
基于偏好优化的可泛化终身模型编辑
GLIME结合知识编辑与偏好优化,借回放与梯度约束,提升终身编辑泛化并保持模型通用能力。
MLToolBench:面向机器学习开发的工具增强智能体学习
提出诊断工具集与SPICE轮级奖励训练,使智能体学会用工具,域内成功率升至69.2%。
ProGuT:面向森林场景的标签高效全景分割
ProGuT借助CLIP特征聚类与结构张量几何先验生成全景伪标签,无需逐图掩码,森林分割性能显著超越无监督基线。
无需共享门控或跨智能体梯度的自监督协作视觉专家群体中的涌现专业化
无共享门控与跨智能体梯度,自监督视觉专家群体仍能涌现有用分工,语义路由优于单一通才。
RoXDrive:通过动作忠实推演实现端到端自动驾驶的闭环强化学习
RoXDrive:识别动作忠实世界模型推演,进行闭环强化学习后训练,显著减少自动驾驶安全违规。
BiFE:基于LLM双保真度演化的搜索高效纯CPU分支策略发现
BiFE以低保真预筛、高保真评估精英,高效搜索纯CPU分支策略,性能超越SCIP及部分GPU策略。
AI科学家会改变想法吗?合成宇宙中的先验—证据冲突
提出合成宇宙基准,配对经典与扭曲孪生世界;发现预测充分性与机制恢复相分离,须分别检验。
无法恢复从未被测量之物:量化超低场MRI超分辨率的信息上限
真实64mT MRI个体信息仅约3–4mm;合成数据高估可恢复性,超分细节难辨恢复与虚构。
智能体能否为智能体设计程序库?
推出LibraryDesignBench基准,评测智能体为智能体设计库的能力,发现下游复用不足,改进指引可提升复用与简洁性。
JudgeProfile:理解并引导 LLM 裁判的主观性
JudgeProfile将LLM评判拆为感知与优先级,重加权调控主观性,一致率升至71.97%。
社交性锚点:迈向群体边界约束的轨迹预测
提出 Socialality 框架,以可解释锚点和扩展窗口实现个体化、上下文自适应分组与群体轨迹预测。
同策略视觉证据蒸馏
提出ReVuE同策略视觉证据蒸馏,对比学生轨迹诊断获取/读取/对齐失败,反思重加权token蒸馏损失,提升视觉推理。
VGGT 系列模型需要用到所有层吗?
VGGT 系列前馈几何模型的可删层集中于前段与后段,剪枝并经线性校准后可减少44%参数而精度持平。
SIPO:统一强化学习与同策略自蒸馏
SIPO以对比自教师提供密集token级反馈,统一强化学习与同策略自蒸馏,推理和代码任务超越RLVR与OPSD。
S4VY:前馈4D视觉几何中的任意分割
提出S4VY,基于前馈4D视觉几何实现类无关4D实例分割,支持提示与语言引导,性能领先。
世界模型的自适应潜在容量
提出ALeWM,基于JEPA将预测信息集中于宽潜在表示的紧凑前缀,并设计MixSIGReg防坍缩,成功率更高、规划容量更低。
GlassFormer:基于雷达-深度融合的实时玻璃分割学习
融合雷达与RGB-D,提出GlassFormer,以跨模态注意力实现实时透明表面分割,低光下稳健。
超越词元对齐:跨分词器同策略蒸馏中的事件补全
提出事件集补全蒸馏,用补全集监督补充跨分词器概率对齐,免额外采样,在数学、代码与科学推理蒸馏中稳定提升。
梯度噪声下的 Muon 与最优解附近正交化的局限
最优解附近噪声主导时,Muon 正交化仅匹配一阶响应,残留协方差抬高损失下限,宜改用匹配动量 SGD。
调整语义而非结构:面向科学PDF抽取的少样本模式校准
提出CPSE框架,用少量标注校准字段语义与提示并保留结构契约,在聚合物文档上较基线提升9.93分。
EASE:面向自进化智能体的行为自适应技能策管
EASE让智能体按执行器行为在线自适应策管技能,跨执行器共享强化学习,技能更精、检索更准、开销更低。
区分还是同化:不可逆资源耗尽下的最后机会策略识别与风险预算恢复
不可逆资源耗尽下,权衡区分故障与同质化状态,提出最后机会策略识别和风险预算恢复,满足失败预算。
更少监督,更好泛化:扩散编辑图像中的弱监督伪造区域定位
提出弱监督框架ReGFLoW定位扩散编辑伪造区域,仅需图像级标签,以扩散重建误差引导多示例学习,跨域泛化优于全监督。
驻留吸引子:在神经代理模型离开吸引子处监督三维湍流
提出离吸引子监督,用DNS重标注偏离态,三维湍流预测失败中位步数由21升至721。
Draft-KV:学习语言模型间有用的潜在通信
Draft-KV 以起草答案的 KV 状态做潜在通信,冻结模型仅训 1.05M 参数,显著提升接收器准确率。
S2T-Unet:一种面向跨模态MRI转换的结构到风格框架
提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。
TQTS-Bench:面向时序数据库的多语法文本到查询基准
含6125个问答对、97个时序数据库与23种语法;最佳模型准确率仅48.98%,人类达87.34%。
更少刷新,更优选择:复用陈旧梯度特征实现高效的基于影响数据选择
提出CDIS,复用陈旧梯度特征,仅重算高分候选并校准,选择成本仅约1/3.4,性能近全量重算。
LongPuzzleBench:评估 GUI 智能体在长程视觉谜题上的表现
LongPuzzleBench评估GUI智能体长程视觉谜题:114关六款游戏,强智能体在更难长局骤败,因其只看当前进展、不顾未来选择。
InfiMed2:基于上下文证据与稳定性感知监督的通用医学多模态基础模型
InfiMed2为4B/27B通用医学多模态基础模型,阶段感知数据设计与稳定性监督,医疗基准超越开源同类。
函数级漏洞评分更多衡量标记率而非模型:协议对配对基准的影响
函数级漏洞F1主要反映标记率而非模型:固定输出下协议影响小,模型与基准差异更大。
从弱任务规范到科学抽取智能体:优化任务构建
针对科学抽取智能体,提出从简短目标与未标注文献的弱规范出发,自动构建并持续优化任务模式、抽取指令与评估标准。
面向指令遵循泰英机器翻译的参考锚定数据整理
提出参考锚定数据整理法,构建197万条数据训练泰英翻译模型ChindaMT,各规模均超同尺寸基线。
OpenWhistle:大规模纵向宽吻海豚发声数据集与基准
发布首个公开宽吻海豚哨声数据集,含五年约18万条录音、专家标注及评测基准。
及格还是不及格?在两项希腊考试基准上评估大语言模型
发布两项希腊考试基准,评测多款大模型;本地化小模型媲美大模型,少样本提示反致结构化任务性能下降。
面向冻结EEG表征的测量门控来源衰减
提出MGPA:在测量门控内校正来源分数,无需重训;跨设备与任务可降低来源可预测性并保持/提升性能。
仅预测下一状态还不够:面向 Lean 定理证明的 JEPA 表示
JEPA提升Lean单步后继排序,却未提高长程证明成功率,说明仅预测下一状态不足以指导搜索。
优化扩散引导RRT的H图混合
针对预训练DiTree,两种免训练推理期多样化策略经H图混合,在AntMaze上平均缩短路径约两成。
当更少计算带来更优效果:自适应早退提升预训练离群点检测
首次研究预训练离群点检测的自适应早退,最优中间层退出可提升检测4.7–7.3%并借助路由加速。
Allspark:通过交替思维链实现弱到强迁移
Allspark以交替思维链实现弱到强迁移,跨模型提升准确率,并考察准确率-令牌权衡。
ARC-KV:为基于重构的KV缓存压缩摊销锚点搜索开销
学习可复用锚点选择策略,单次评分选锚并复用压缩KV缓存,压缩提速25.7倍且精度提升。
Code4Scene:面向3D场景构建与编辑的编程智能体基准测试
以190个虚幻引擎场景评测编程智能体的3D场景构建与编辑,发现二者强相关却不可互换,最佳修复F1仅0.527。
DiffReID:面向目标重识别的判别式扩散模型
提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。
SafeVantage:面向可靠具身决策的视角感知记忆
视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。
用于跨被试EEG到图像检索的结构化视觉目标学习
提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。
Seg3DParts:基于分割的可控部件级三维生成
将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。
Aperture:用于压缩词元的合并一致旋转状态
Aperture用旋转频率傅里叶矩编码压缩词元的位置支撑,证明维度最小且合并更新可加;视频问答65.63%,略低于67.12%。
UpliftMem:为智能体记忆检索学习集合级增益
UpliftMem以集合级执行增益学习记忆检索,用EVSI准则定向探测,无需测试时探测即取得最佳成功率。
带删失需求与对抗性库存的最优非参数动态定价
在需求删失、库存对抗的动态定价中提出Threshold-UCB算法,实现T^{2/3}阶最优遗憾。