结构偏移下的分子性质预测:基于表格基础模型
提出MolPAIR,用分子对比较增强表格基础模型的上下文学习,免微调提升结构偏移下的分子性质预测。
相同损失,不同梯度
揭示相同损失下梯度可不一致,提出AR/FR实现前后向一致并给出三次误差界。
FLOW:面向泛化远程生理测量的特征级最优扭曲
提出最优传输驱动的FLOW框架,融合时序细化与原型跨时序对齐,实现域泛化rPPG,跨域性能达SOTA。
检索对查询中身份信号的敏感性
稠密检索器对查询中政治倾向与方言信号敏感:结果偏向查询自身立场,非裔美国人英语提问检索效果更差。
CRAFT:医学视觉语言模型中的因果责任与失效追踪
CRAFT定位医学视觉语言模型中文本压过图像与证据不足仍作答的因果注意力头,干预可纠正且无需重训。
STRATA:面向实时策略游戏的基于角色对齐分层智能体的自学习
STRATA为红警设计角色对齐分层智能体,通过赛后复盘与跨局自学习压缩经验卡,胜率由30%提升至100%。
当更新不再是学习:通过可学习的信息增益重新思考大语言模型自我进化
提出可学习信息增益度量自进化每轮新增信息,据此设计ATRI自适应调节训练,缓解性能退化。
大规模因子分析表明机器智能仅部分可解释
大规模因子分析显示,通用智能因子最多解释七成性能方差,相似基准未必聚簇,通用智能难成单一构念。
相似选择,不同注意:人类与视觉-语言模型中的跨模态关联
部分视觉语言模型选择对齐人类,但注意力不如中心基线;匹配选择或注视不等于人类对齐跨模态处理。
基于模型的离线强化学习中的分布内想象
提出分布内想象,在表征空间估计轨迹支持度并截断越界展开,结合轨迹正则化RL,少数据下稳定提升性能。
面向长时程智能体任务的一致性规划-行动
揭示规划者-执行者状态错配,提出ConPAct以矛盾反馈和一致性微调提升协调与成功率。
面向忠实大语言模型股票收益预测叙事的推理外化
结合时序SHAP与历史类比,外化推理可提升LLM股票收益预测叙事的证据忠实度与准确性。
多精确才算足够精确?
数值精度是否足够取决于当前学习状态;相同原始误差可致不同学习后果,故精度应视为学习目标的一部分。
FinRT:将自适应红队策略蒸馏为消费金融领域可复用的对抗生成器
FinRT将自适应红队策略蒸馏为可复用对抗生成器,攻击成功率近翻倍,最大危害提升33%,同时保持多样性。
记忆巩固抹平用户事实的时间形态
记忆写入会不对称地抹去进行时等时态线索,使后续模型难以判断用户事实是否仍然成立。
概率对比学习中,共享温度是否意味着共享角度尺度?
概率对比学习中,共享温度≠共享角度尺度;vMF角度增益影响边界与梯度,均衡后恢复共享尺度并提升表征。
《美丽心灵的永恒阳光:系统性抹除大语言模型的记忆》
LLM难以按要求遗忘信息;提出DeLLM框架,用溯源图识别需删除的消息,兼顾高删除率与实用性。
风险感知的自适应评估:在有限预算下发现高影响失败
风险感知上下文汤普森采样用于序贯分配评估:仅50次试验即找回86%高影响失败,均匀分配仅25%。
未来视频生成比观测视频更契合人类视觉皮层
未来视频生成表征比观测视频重建更契合人类视觉皮层,尤其高阶皮层;人类偏好放大高对齐层贡献的视频。
MemFold:通过在线策略优化学习面向长上下文个性化的紧凑软记忆
将文本记忆压缩为K个连续向量,用奖励与置信门控在线蒸馏优化读者行为,长上下文个性化性能领先。
超越困惑度:抽象预训练的持久影响
抽象栈任务预训练仅占1%词元,可提升小模型多跳推理3.9 F1,效果持久,结构与时机关键。
原型引导的双边对齐多模态联邦学习
提出原型引导双边对齐多模态联邦学习框架,通过特征与决策级对齐应对异构和模态不平衡,性能领先。
DCM-SAM:面向NPU部署的增材制造缺陷分割的缺陷条件化LoRA专家混合模型
提出缺陷条件LoRA专家混合DCM-SAM,冻结SAM仅用合成切片训练;ViT-B在真实NIST孔隙IoU达64.2%,并可在Hexagon NPU上FP16部署。
蒸馏扩散分数差异用于高效训练数据归因
提出TID,以局部分数差异归因并免重训;蒸馏为TIDE,毫秒级归因生成样本,性能领先。
DecoMoE:解耦视觉传播与专家计算,实现高效多模态 MoE 推理
DecoMoE解耦视觉传播与专家计算,压缩多模态MoE推理,保持97.91%性能并加速1.69倍。
FrameMorrow:面向长时程视频生成的未来引导帧选择与前瞻Token
FrameMorrow预测未来信息需求的前瞻token,据此筛选历史帧,可插拔集成,提升长时程视频生成一致性。
在固定置信度分布下,可靠性会漂移多少?
研究固定置信度分布下、协变量偏移时可靠性的最坏漂移,提出脆弱性曲线并估计下界,在ImageNet上验证。
解耦球面推理与密集预测的360°深度估计
提出斐波那契球面图与球面上下文调制,解耦球面推理与ERP密集预测,提升360°深度估计。
AdaOcc:面向具身任务的自适应三维占用预测
提出AdaOcc点式自适应3D占用预测,支持多传感输入与算力可调,用包含损失提升几何建模,在Occ-ScanNet上达最优。
MEMO:面向流式视频理解的多层级实体感知记忆
提出免训练即插即用的MEMO,以多层级实体感知结构化记忆建模流式视频,保留细粒度证据,提升多项基准。
遗忘中的学习:随机训练动力学中的统计支撑选择性保留
RPF动力学:重复强化+持续遗忘,视遗忘为选择,保留强支撑并致MDL压缩,实验验证可调归纳偏置。
定向检索,紧凑表征:CoT推理如何提升长上下文计数
研究发现思维模型通过CoT枚举逐一检索目标,注意力更集中、内部表征更紧凑,并以CoT轨迹维护更新内部计数器。
免训练的不确定性引导调控:缓解推理任务中的幻觉
提出免训练方法USteer,利用置信度梯度引导推理时激活,降低不确定性以减少幻觉。
为AI研究论文生成诱发修改的问题
对比GPT与人类评审:GPT能生成更多触发修改、涉及更广的问题,但有效比例较低。
图像分割中条件独立假设的松弛
RankSEG因条件独立假设忽略标签相关性;提出空间局部依赖建模,结合矩近似与不动点优化,O(d log d),低对比小目标显著提升。
哥德尔森林:平衡以数据为中心的递归自我改进中的搜索深度与广度
哥德尔森林以多智能体协同演化搜索树和共享记忆,兼顾深度与广度,显著提升以数据为中心的递归自我改进。
当顺序至关重要:顺序多智能体辩论中的首位发言者偏见及基于人格的缓解
顺序多智能体辩论存在首位发言者偏见,强者后置削弱其优势;降低强方宜人性可恢复其影响力并提升准确率。
路由探针无需新信息也能提升:对模型输出之外不确定性的精确零假设审计
精确零假设审计发现,路由探针增益多因按准确率选检查点;修正后假阳性消失,拟合探针不等于检验增量信息。
超越空间域监督:面向多模态图像融合的关系约束空间
提出关系约束监督范式,将融合监督从空间域移至学习关系空间,以预训练特征适配器建模共享、主导与协调关系。
可视化生成扩散模型中的分布覆盖
提出pass@k评估扩散蒸馏,发现单样本高分常以分布覆盖为代价,目标选择决定覆盖保留,图像视频皆然。
RealWorldShop:在真实电商环境中对会话式购物智能体进行基准测试与改进
构建328万商品的会话购物基准,揭示状态跟踪与约束更新不足,并提出REALSHOP_AGENT框架。
蒸馏关键内容:面向大语言模型的置信度感知选择性蒸馏
CaRE-KD按师生置信度自适应切换KL、抑制教师不确定更新,在11项基准上稳定提升。
TED:面向提示式异常定位的文本轴证据分解
TED无需目标域训练,以文本轴证据分解区分缺陷与困难正常区,提升CLIP异常定位像素级可靠性。
PARK:面向视频扩散Transformer稀疏注意力的精确块检索
PARK免训练,保留独立查询、按当前查询聚类键,纠正块检索偏差,兼顾视频生成质量与推理加速。
评估模型知识演化下的持续校准
持续校准:置信度须随模型知识变化且无需持续监督;跨检查点测试显示现有方法不足,多检查点训练有助改善。
通过错误发现控制的视觉数据划分缓解大型视觉语言模型中的物体幻觉
提出免训练框架CORAL,利用不确定性感知视觉数据划分与镜像统计控制图像级错误发现率,有效抑制LVLM物体幻觉。
C-STRIDE:一种观测驱动的人工智能数字孪生,用于从稀疏水文站历史记录预测全流域洪水场
少量水文站记录+地形降雨,AI数字孪生可预测全流域洪水深度并提前一天,误差约15%,速度快150倍。
ProgressCompass:具身进度奖励模型若无正确上下文便会迷失
长任务中PRM需上下文方能估计进度;提出ContextProgress-Bench与ProgressCompass,误差降63%。
面向不确定基线的保守型老虎机:储备感知的对比证书
Reserve-C4B以共享置信集与储备账本刻画基线对比,避免误差重复计入,显著减少基线回退。
搜索塑造结论:审计深度研究智能体中的证据选择偏差
提出CESS审计深度研究智能体的证据选择偏差,校正候选池估计,并区分其与搜索政策干预效应。