面向神经编码与解码的稀疏视角可解释三维动物行为表征
SABLE以自监督几何先验从稀疏视角重建可解释的三维行为表征,零样本泛化,助力神经编码与解码。
Mirror-Score:校准的仅推理评分揭示D-肽设计中序列兼容性排序的局限
提出Mirror-Score校准评分框架与31个复合物基准,揭示序列似然无法预测D-肽亲和力,镜像共折叠置信度家族内排序更可靠。
从敏锐之眼到专家思维:在 MLLMs 中内化专家知识实现篡改文本检测
提出 EKI 两阶段框架,将专家取证知识内化到 MLLM,解决双重不匹配,在篡改文本检测上达 SOTA 且推理高效。
SMat-Attention:结构化长上下文序列建模
以VC维d为可调旋钮构建结构化因果掩码,提出SMat-Attention,兼顾亚二次预填充与常数时间解码,并可扩展至Mamba-2等模型。
LongCat深度研究技术报告
提出LongCat深度研究系统,结合增强模型与多智能体工作流,分离全局规划与局部调查,支持分节修订,在多个基准测试中表现优异。
生成中的表示设计:扩散 Transformer 中的跨视图类令牌对齐
在扩散变换器中引入跨视图类令牌对齐,联合流匹配训练,提升表示质量且不损生成质量。
AI理解的复调式构想
LLM输出源于多个并行机制组成、可靠性不均的联盟;应据可靠控制输出的健全回路判断理解,以指导信任。
GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑的地理时空KGQA基准
提出GeoOutageBench基准,评测大模型地理时空KGQA的歧义理解、本体效用与多模态停电韧性分析能力。
三思而后修:笔画引导注意力的风险感知满文手稿修复
提出SAGE-Restore选择性修复框架,先评估需修复区域,以笔画结构线索与像素软门控,兼顾退化恢复与完好内容保留。
手握地图仍迷路:语言模型中的对话状态与行为可靠性
模型能读出对话结构却难解析值,旧值更新后仍影响行动;据此设计的控制器修正动作,显著提升查询与任务成功率。
潜在预测车辆表征保留了什么?测量状态、几何与局部响应
提出协议分测潜预测车辆表征的保留、预测与局部响应;其保留状态,但命令响应偏离模拟器。
智能体何时才有用?古典文本及其译本的嵌入、大语言模型与智能体对齐
七系统对比:生成式恢复率93-94%远超嵌入77%;智能体缺陷更少,但长文本优势经分块后消失。
Bison:面向未见化合物扰动预测的跨数据集学习
提出跨数据集联合训练模型Bison,利用药物对比监督预测未见化合物扰动,药物差异相关性提升27.4%。
论言语化置信度先验在大型推理模型校准中的陷阱
LRM置信先验集中于少数高值,抑制RL校准;CalibSFT先塑造校准先验,降低校准误差并提升判别力。
从细粒度修改操作到有意义的修改单元:评估大语言模型在修改边界检测中的表现
微调Qwen3-32B识别学生修改单元边界效果最佳,优于提示式大模型与启发式基线。
理解激活解释中的虚构并重新思考重建
点重建解释易致虚构与写作缺陷;提出Flow-NLA建模激活分布,保留效用并抑制缺陷。
SoFT:面向可泛化大语言模型微调的软目标
提出SoFT软目标微调,通过最小KL改动平衡演示学习与基座能力,提升分布内与分布外泛化。
共享经验、分离学习:面向大语言模型的伴随式置信度校准
CoCal以共享轨迹、分离学习训练轻量伴随模型校准LLM置信度,不损任务性能,优于RL与事后校准,并可跨域泛化。
联邦LoRA应共享什么?基于输入感知子空间对齐的FedSAIL
FedSAIL以输入二阶矩构建动作矩阵,其右奇异主子空间跨客户端对齐,据此正则本地训练并保留客户端系数,提升性能、降低通信。
面向统一多模态模型的演化数据相互对抗自训练
提出MATE,让生成与理解分支互相对抗自训练,挑战随模型演化,在Janus-Pro-1B上提升多项基准。
神经动力学即量化单元的组合
提出"量子"抽象:训练是按需求与条件复杂度有序获取可复用计算单元,可解释宏观损失与缩放律。
位置并非事实:KV 缓存与记忆之间的错配
更新KV缓存需保留单位、对象依赖与未变文本;重建旧位置会损历史准确率,识别需学习读出或查询访问。
渐进式指令交付对语言模型创意写作的影响
分多轮渐进交付写作要求会降低模型约束遵守度,结构连贯性受损最重,创意完整性仅存71.2%。
Unicode 中的约鲁巴文:一个问题概述
约鲁巴文 Unicode 缺预组合字符,跨平台显示、搜索和字体替换出错;呼吁联盟介入申请编码四个核心字符
Rondo:无监督发现重复性时间结构
Rondo 无监督发现连续时间流中层级的重复结构,动态扩展单元词表,在少数据与持续流中优于基线。
大型强子对撞机上快速精确的基于学习的带电粒子轨迹回归
提出双向门控线性循环编码器,带电粒子轨迹回归达经典拟合全精度,GPU推理加速,降低LHC计算成本。
语音识别中编码器-解码器模型的上下文自适应
编码器-解码器模型均能直接上下文自适应,最高相对提升30%,词法与说话人信息均起作用,拼接式演示最稳定。
面向一次训练、多预算导出的弹性选择性谱混合模型
ESSH融合选择性谱混合与滑窗注意力,联合训练多容量,一次训练多预算导出,质量近同级且解码加速。
LA-CPD:用于人类-LLM作者身份分段的局部证据感知变点检测
LA-CPD将句级噪声分数转为连贯作者分段,动态规划与AIC选变点,准确率升至0.796,边界定位更优。
Kolmogorov-Arnold网络与多层感知机中的Fisher简单性
KAN与MLP的Fisher简单性:死ReLU一致,KAN系数大小不能作剪枝准则,多层需有效路径。
StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习
将长时程任务分解为可验证子任务,按完成进度给予结构化中间奖励,显著提升VLA长时程任务表现。
Merlin Plus:一个大规模、多癌种、图像-掩膜-报告数据集
首个含9器官肿瘤掩膜的大规模CT数据集,用报告驱动主动学习降低标注成本,支持癌症检测、分割与纵向分析。
AdaST:面向时空预测的自适应耦合
提出AdaST框架,以分解-重组自适应建模时空耦合模式,显著提升预测性能并超越现有方法。
CoRe:协同进化奖励模型以缓解视频扩散模型中的潜空间奖励劫持
CoRe让奖励模型与生成器协同进化,以真实视频偏好锚定,避免分布漂移引发的奖励劫持,提升视频生成质量。
高倍放大知识为何可迁移?全切片成像中的跨分辨率蒸馏研究
跨分辨率蒸馏中,重建误差不足以衡量迁移效果,学生预测能力与模型利用共同决定下游收益。
压缩以记忆:通过在线策略蒸馏学习紧凑记忆以实现长视频生成
提出PACC,用在线策略蒸馏训练压缩器,将历史帧压缩为紧凑记忆标记,不改生成器即增强长视频记忆与一致性。
FigAct:让科学图表成为可主动演绎的讲解画布
将静态科学图表转为按问题生成的视觉演示,通过元素定位与视觉动作引导注意力,使讲解更清晰易懂。
OTT3R:以1%算力实现多视角三维重建与快速数据集生成
以1.6%算力蒸馏出1.02亿参数学生模型,3.5小时生成66.7万张图像伪标签,精度超COLMAP且快980倍。
LEGO-Anything:面向三维场景重建的编码智能体
编码智能体迭代编写并执行Blender代码重建三维场景,并引入评测基准与改进插件。
记忆即推导:长期智能体中的分布式证据悖论
长期智能体记忆能否由历史推导存疑:扩展历史可找回近六成无据记忆,但17%-21%仍无据,准入不可靠。
潜空间递归大语言模型系统的原则性思考
REST把有效思维的因果、最小、可分、稳定四性转为可微损失,与交叉熵共训,准确率提升7.5个百分点。
VLA 的层之谜:VLA 潜在接口的信息论分析
VLA潜在接口选层:多层融合多不如最佳单层,最佳层随模型/任务变;InfoNCE代理选层,降遗憾。
面向鲁棒室外激光雷达定位的时序感知融合
提出TempLoc时序感知框架,结合全局坐标估计与不确定性引导融合,提升室外LiDAR重定位鲁棒性。
隐蔽性是关系,而非属性:事件表示如何为基于事件感知中的时序攻击制造盲点
事件表示使隐蔽性成为观察者关系;Null重定时攻击利用时序盲区,保持受保护张量不变并获高成功率。
面向可扩展、上下文感知的组织学图像单细胞空间转录组预测
CELLO单次前向并行提取全细胞特征,距离衰减注意力融入局部上下文,跨12器官千万细胞,提速14倍。
更多特征并非更多证据:基于 Jev 的免训练人体活动识别的局限
Jev免训练人体活动识别远逊监督模型;更多数值特征反降性能;传感器到模型接口是评估关键。
RA-CFGCache:从分支级准则到无分类器引导下的引导风险控制
提出RA-CFGCache,在无分类器引导下融合分支误差与传播风险,在线控制缓存,改善效率与保真权衡。
随机策略基线缺失下,程序化生成泛化差距究竟衡量了什么?动作规则、收敛性与缺失的随机下限
强化学习泛化差距常缺参照,应报告同关卡随机策略下限;动作规则与收敛口径会显著改变结论。
MERID:基于递归自我改进智能体的多模态探索用于重度抑郁症分析
MERID利用递归自我改进智能体,联合优化多模态表示、融合与预测器,在抑郁症检测与严重度估计基准上最优。
激活流:为引导而制造激活
ActFlow无需微调,仅凭k个正确标签合成激活,将沙袋式锁定模型的准确率从0.05提升至0.85。