仅预测下一状态还不够:面向 Lean 定理证明的 JEPA 表示
JEPA提升Lean单步后继排序,却未提高长程证明成功率,说明仅预测下一状态不足以指导搜索。
优化扩散引导RRT的H图混合
针对预训练DiTree,两种免训练推理期多样化策略经H图混合,在AntMaze上平均缩短路径约两成。
当更少计算带来更优效果:自适应早退提升预训练离群点检测
首次研究预训练离群点检测的自适应早退,最优中间层退出可提升检测4.7–7.3%并借助路由加速。
Allspark:通过交替思维链实现弱到强迁移
Allspark以交替思维链实现弱到强迁移,跨模型提升准确率,并考察准确率-令牌权衡。
ARC-KV:为基于重构的KV缓存压缩摊销锚点搜索开销
学习可复用锚点选择策略,单次评分选锚并复用压缩KV缓存,压缩提速25.7倍且精度提升。
Code4Scene:面向3D场景构建与编辑的编程智能体基准测试
以190个虚幻引擎场景评测编程智能体的3D场景构建与编辑,发现二者强相关却不可互换,最佳修复F1仅0.527。
DiffReID:面向目标重识别的判别式扩散模型
提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。
SafeVantage:面向可靠具身决策的视角感知记忆
视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。
用于跨被试EEG到图像检索的结构化视觉目标学习
提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。
Seg3DParts:基于分割的可控部件级三维生成
将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。
Aperture:用于压缩词元的合并一致旋转状态
Aperture用旋转频率傅里叶矩编码压缩词元的位置支撑,证明维度最小且合并更新可加;视频问答65.63%,略低于67.12%。
UpliftMem:为智能体记忆检索学习集合级增益
UpliftMem以集合级执行增益学习记忆检索,用EVSI准则定向探测,无需测试时探测即取得最佳成功率。
带删失需求与对抗性库存的最优非参数动态定价
在需求删失、库存对抗的动态定价中提出Threshold-UCB算法,实现T^{2/3}阶最优遗憾。
面向 AI 辅助工程的 CAD 原生 Transformer 算子
提出 CANTO:免网格 Transformer 神经算子,从连续 CAD 预测物理场,气动基准领先且支持逆设计。
表征动态揭示多模态大语言模型视觉 Token 剪枝的语义显著性与相似性
视觉token表征动态揭示语义显著性与相似性;据此提出免训练剪枝MSDG-Prune,大幅压缩视觉token并提速。
AI 作为编译器:无需 Triton 编译器即可编译 Triton 内核
让大模型智能体将 Triton 内核直接编译为 PTX,性能达自动调优 Triton 的 0.83–3.34 倍,并扩展验证器支持 Blackwell。
WeLike2Party!面向多人图像动画的上下文动作迁移
提出免显式姿态的多人动画框架,以参考非对称RoPE与身份绑定监督实现上下文动作迁移,构建MotionTwin数据集与基准。
SFE-VGGT:面向事件相机单目深度估计的无源VGGT蒸馏
无源SFE-VGGT用事件重建代理帧蒸馏VGGT几何先验,可靠性加权,无需配对RGB,夜间误差降15%。
DispFlow-GS:面向单目可变形三维高斯泼溅的位移流监督与运动解耦
提出位移流监督与运动解耦框架,缓解高斯流与光流域差异,并引入形变-渲染一致性指标,显著提升运动定位与一致性。
面向非线性传播的图神经网络高效动态算法
提出非线性图神经网络传播动态维护算法,边增删下摊销O(1/ε)更新,兼顾精度与效率。
倚仗思考的计数:追踪语言模型中的证据整合
大模型直接作答计数存在近因偏差;思考能构建累积计数使证据权重均匀,但难以通过学习内化为直接反应。
面向时间扭曲鲁棒序列检索的几何条件化固定支架编码器
GeoPatch采用固定支架编码器,几何仅作条件调制,提升心电、语音等时序检索抗时间扭曲鲁棒性。
在正确的步骤给予正确的教训:为自演化智能体推导控制更新
EvoCUE 将智能体建模为状态机,在精确位置学习并评估控制更新,提升长工具链任务成功率。
先验驱动的3D高斯泼溅增强:法线与深度正则化
提出融合表面法线与稠密深度先验的3DGS优化方法,提升几何精度与视觉质量,在复杂场景中表现稳健。
行为之回响:道德历史能够塑造并引导大语言模型的行为选择
道德账本框架显示,大模型道德史按效价与强度影响选择,其潜表征可线性提取并干预,实现推理时可控制。
结构化约束 MDP 中在线强化学习的末次迭代保证
面向结构化约束 MDP,提出在线强化学习末次迭代收敛框架,支持免模型函数逼近并验证正则化稳定效果。
默认陷阱:重新思考工具使用型LLM智能体中的计划评估
研究揭示“默认陷阱”,主张工具型LLM智能体计划评估应联合报告优先级响应、默认依赖及任务成功/成本。
神经语言模型学习依存结构的语境分布:一种走向组合性的统计学习理论
神经语言模型将习得的依存结构作为新的分布学习单元,先掌握依存关系,再学到其语境分布,从而解释组合性。
校准改变未来的决策:面向多模态大语言模型的同策略训练后量化
提出OnPTQ:按当前量化策略轨迹校准,以决策-后果风险评估关键状态,提升多模态模型低比特量化性能。
超越可读性:评估任务信息可恢复性
可读性≠任务信息可恢复性;提出显式评估框架比较恢复路径,图书封面实验显示实体链接恢复可超越直接视觉读取。
语义不确定性量化需要事实等价性
语义不确定性量化瓶颈在现成比较器难判事实等价;训练对比编码器隔离事实可显著提升并改进词元估计。
现象图 JEPA:用于非接触式心肺传感的标签高效表示学习
提出现象图JEPA自监督框架,用于非接触心肺传感,标签效率提升约3.9个百分点,但生理分型未获证实。
Nürnberg NLP 在 ChildSafeAds 2026:四种数据访问级别下的结构相异投票者集成
为儿童向视频商业内容监测构建九投票者集成,在四种数据访问级别下评估,三子任务中两夺冠,均值列第三。
SignFLIP:基于大规模分阶段对齐的手语翻译与生成统一模型
提出统一框架SignFLIP,以LLM为核心,经大规模分阶段对齐实现手语翻译与生成,媲美专用模型。
随机性对机器学习中罗生门效应的影响
研究独立调控权重初始化、批数据顺序与dropout,发现三类随机源对罗生门效应的解空间、预测与决策依据多重性影响各异,三者互补而非可互换。
场景理论:打破多智能体大语言模型协同中的对称性陷阱
同质LLM智能体无通信并发易陷对称陷阱;提出免训练ToS,靠公共角色与场景分工,在多个基准超越基线。
语言模型内省的机制研究
固定输入下注入概念向量,发现中层门控头决定是否报告,后层路由头定位扰动,准确率依赖概念向量对齐。
从规范框架到对齐数据:构建与评估SFT与偏好数据
七位专家依伊斯兰伦理构建2.8K SFT与5.4K偏好数据;SFT显著提升对齐,偏好数据增益不显著。
逻辑的几何:分层诱导语义结构与稳健推理
STRAT将残差流分为数据/类型子空间,提升逻辑推理泛化;算术OOD误差降35倍,分布偏移下更稳健。
理解同策略蒸馏:基于稀疏交叉编码器的机制可解释性视角
借助稀疏交叉编码器与交换读出法发现:同策略蒸馏不创造新特征,只是重新加权学生已有的共享特征。
陈旧度在哪里累积?面向大语言模型后训练中异步RL的池感知有效陈旧度控制
将轨迹陈旧度分为生成与等待陈旧,提出池感知PACE控制,提升异步RL精度并省47% GPU时间。
TwinS-GCN:用于谱图卷积网络的谱共轭
提出谱共轭分解移位算子,构建TwinS-GCN双滤波器,实现长程无衰减传播,节点分类具竞争力。
面向PDE贝叶斯反演的自然语言条件生成先验
自然语言条件生成先验,融合文本、数据与少量噪声传感,用于PDE贝叶斯反演与不确定性量化。
当置信度过早上升:通过过早答案承诺检测捷径推理
提出ConfLens追踪答案置信度演化,用DACS分布熵检测过早自信捷径,改善奖励模型偏好。
IronLLM:为实时具身智能锻造紧凑的端侧原生语言模型
IronLLM-0.6B为6.54亿参数端侧语言模型,融合混合注意力与X-MTP多token预测,解码提速1.48倍,性能媲美更大模型。
中文标题:PrecogUI:通过预认知模拟与经验检索实现的主动式GUI智能体
PrecogUI预认知架构融合经验池、模拟预测与闭环纠错实现主动决策,在强干扰长程任务上超越现有方法。
基于统计形状模型与深度学习的骨盆骨折复位螺钉自动规划
提出全自动骶髂螺钉术前规划流程,自动识别安全通道并生成个体化轨迹;200例验证:安全边界提升2%,规划时间减少逾90%,接受率达95%。
状态轨迹推理解释作为强化学习中的辅助任务
STRAT以预测自身状态文本轨迹为辅助任务,助RL攻克稀疏奖励难题,压缩状态表示并提供可读解释。
World2Motion:将视频世界模型转化为三维人体动作生成器
将视频世界模型改造为单阶段3D人体动作生成器,构建混合数据并提出偏移解耦噪声调度,推理提速约3.3倍。
视觉并行搜索:通过并行瓦片检查与自适应缩放学习搜索高分辨率图像
提出VPS视觉并行搜索框架,主智能体并行检查图像瓦片并自适应缩放,提升高分辨率视觉问答,且可训练。