LLM 能否可靠地标注生物测定元数据以提升数据就绪度?
PubChem 生物测定元数据严重缺失;评测显示 LLM 标注召回率高、开源与闭源差距小,可规模化辅助标注与审计,但需人工复核。
ALER:面向强化学习的自适应可学习经验重写
提出ALER,将LSTM与槽记忆结合,以可学习写入和门控融合重写经验,在迷宫任务中优于基线。
Dyna3:基于深度基础模型的 VLM 引导免训练 4D 重建
Dyna3免训练扩展深度基础模型至4D重建,VLM引导分割分离动静,精度更优、速度快、显存低。
ODDR:基于奖励引导的单步去阴影扩散
提出ODDR:合成数据训练单步去阴影扩散ODD,结合无标注奖励模型微调,缩小合成到真实差距。
TRACE:轨迹回报归因与对比擦除,面向多轮对话安全
TRACE以token级回报归因与对比擦除约束多轮风险,在35个模型—攻击组合中均获最低攻击成功率,效用损失不超过1.23分。
Yo-ByT5:高效高保真的约鲁巴语变音符号还原
提出字节级变音符号还原模型Yo-ByT5,参数仅为mT5-base一半,性能相当且文本保真度更优。
扭蛋解码:通过指令遵循激发多样化生成
Gacha解码把多样性视为指令遵循问题,结合外部随机数实现高质量多样生成,并随模型能力增强而提升。
面向任务的秩适配:文本分类中的持续学习
提出TORA几何路由框架,依LoRA低秩结构相似度选择迁移或隔离,避免遗忘与负迁移,在15个基准上有效。
ARROW:真实场景中4D观测的任意重建与追踪
提出前馈模型ARROW,以顺序无关查询统一任意图像集的3D重建与点追踪,在多基准达最优。
超越记忆:以显式信念状态驾驭长时程智能体
PoS构建并维护显式信念状态作为决策上下文,校验一致性、检测信念陷阱并针对性恢复,四基准性能领先。
PPO-HRAP:面向风险可控交易的混合市场状态感知策略的近端策略优化
PPO-HRAP融合可解释市场状态先验,SPY回测总收益27.6%,最大回撤从34%降至18.5%。
FiVOS:基于交互式视频目标分割与滤波器增强的鱼类分割算法
提出FiVOS鱼类分割方法,以掩码块滤波与噪声过滤抑制误差累积,在鱼类视频分割任务中达到SOTA。
hZACH-ViT 中受攻击的曲率:规范对称性、边界饱和与对抗失效
hZACH-ViT中庞加莱曲率与尺度、边界饱和耦合:降曲率提升干净精度却加剧对抗脆弱,非内在鲁棒。
在真实气象站观测上基准测试生成式天气数据同化模型
首个真实站点观测的生成式天气同化基准:生成先验优于3D-Var,全梯度引导最佳,稀疏站点更明显。
CLASP:基于单一超网络的空间定位概念持续低秩适配器
提出无回放持续个性化法,用单一固定超网络生成概念低秩适配,支持空间控制,参数量不随概念数增长。
利用野外自我运动监督声源定位
用自我运动作弱监督学习双耳声源定位,结合视觉几何与传统双耳线索,在真实音视频数据集上验证有效。
PRISM:衡量与优化多模态类比的范畴论框架
提出PRISM,用范畴论拉回分数量化多模态类比关系对齐并迭代优化图像,提升隐喻一致性,但偏向视觉繁杂构图。
生成溯源先于行为归因:审计合成语音研究对象
提出生成溯源基座,审计合成语音研究对象,认为生成溯源是行为归因的必要非充分条件。
超越单峰基础:多模态数据的拉回几何
提出多模态数据的混合流形拉回几何,以高斯混合建模,改善插值及高似然路径,保持可解释局部结构。
Acmite:通过概念引导的互信息缓解大语言模型中的性别偏见
Acmite以结构化概念表示刻板印象,用互信息最小化训练LoRA并选择性激活,有效缓解LLM性别偏见。
复合词释义基于类比
提出无参数复合词类比模型,以构成词家族平均偏移预测词义,汉语复合词上优于CAOSS,更符合认知。
验证主张,而非分数:模块化智能体的基于证据的验证
提出主张级验证审计,以证据替代评分,用oracle策略、组件替换与验证器测试定位价值损失。
跨部门危机管理本体:核心模块与公共卫生模块
提出模块化OWL本体ECMO,统一危机管理核心概念,公共卫生模块衔接SNOMED CT与ICD-11
Mem++:面向长期组织型 LLM 智能体的非破坏性记忆
Mem++ 提出非破坏性记忆:写入存全文,读取按时间检索并融合排序,提升长期组织智能体问答,优于基线。
JEPA-TTT:面向动力学漂移下规划的潜在世界模型持续测试时训练
JEPA-TTT自监督持续测试时训练潜在世界模型,动力学漂移下预测误差降83%、规划提升153%。
通过对比轨迹排斥实现更平滑的流匹配
提出CoFlow,借对比轨迹排斥降低速度场局部利普希茨常数,改善少步推理,FID显著降低且无额外训练开销。
学习可迁移技能:基于目标条件的互模拟
提出动作感知时序表示与互模拟技能发现方法,仅以影响执行的状态特征约束技能,实现跨布局的强泛化迁移。
MWOP:面向高效多模态大模型的模态感知宽度维度算子剪枝
提出MWOP,按模态路径剪枝注意力、分离视觉与文本FFN通道,预填充提速1.6倍且性能保持99.7%。
LabBook:利用实验历史实现高效的LLM驱动发现
LabBook以智能体维护的记忆引导实验日志检索并辅助生成,提升LLM驱动发现的质量成本权衡。
WOMBAT:用于分子基准测试与归因测试的白盒预言机
WOMBAT提供14个白盒GNN基准,决策规则已知,为分子归因提供真值,评估GNN解释器并推动XAI发展。
面向预训练目标检测的定位感知不确定性
提出轻量事后证据元模型,冻结检测器,以定位误差和显著性课程估计框级不确定性;对抗下TP-FP AUROC最高提升22%。
AiSearch:基于视觉语言模型的交互式多模态搜索
提出AiSearch,基于VLM零样本实现图像视频自然语言搜索,支持反馈优化与多模型基准选择。
处理参数对无人机摄影测量高精度测量的影响
通过768种处理变体评估发现,参数设置显著影响无人机摄影测量精度,优化后系统误差降低超半,为高精度监测提供指导。
面向高效多跳问答的套娃式层次化RAG
MatRAG以套娃表示学习对齐聚类层次,逐层降维索引,自顶向下遍历加实体驱动重排,多跳问答检索质量更优且成本更低。
SkillSpec:通过表征专门化实现共识门控的智能体技能演化
SkillSpec提出两阶段框架:共识门控演化筛选技能更新,表征专门化组织技能结构,六项基准平均成功率提升6.89%。
用于评估大语言模型临床推理的评分量规全景:现有、缺失与需整合
现有评分工具无法覆盖临床推理六维度,需整合二元评分项等,补足不确定性、反事实与忠实性评估。
MMVistaReason:迈向多模态推理的开放数据与后训练配方
MMVistaReason开放数据后训练方案,融合SFT/RL与多专家,4B/9B在15项基准胜更大模型。
对比注意力缓解脉冲Transformer的频谱偏差
揭示脉冲Transformer高频损耗源于低通滤波,提出SCA对比注意力增强高频且通用高效。
使用MoE路由器的仅解码器模型跨语言对齐
用MoE路由器输出替代隐状态对齐损失,实现跨语言表征对齐并提升多语言性能。
初始化提升大语言模型驱动的发现
研究12种模块化框架与5类发现任务,发现模式崩溃,提出并行探索初始化,稳定提升LLM驱动发现。
通用字节级编码:通过 UTF-8/UTF-16 路由缩小跨文字系统词元预算差异
UBE让1-2字节走UTF-8、3-4字节走UTF-16,降低编码下限,缩小跨文字词元预算差距。
带记忆的语言模型对齐的渐近性
将语言模型对齐两种方法的渐近接近性从独立同分布扩展至马尔可夫记忆,并刻画有限长度KL为零条件。
巨正则生成器
提出巨正则生成器,将玻尔兹曼生成器扩展至巨正则系综,含两种设计,在流体与沸石吸附中验证。
不确定性引导的握手:面向手术级胶质瘤分割的高效人在回路精修
不确定性引导人在回路胶质瘤分割:Dice 0.914,HD95 4.76mm,交互量仅11.3%。
奖励即观测:学习基于奖励的策略以实现快速适应
提出仅以奖励和动作为条件的策略,实现观测空间完全不同的环境间零样本迁移与快速适应。
Hob-VL:基于视觉的布尔推理基准
提出Hob-VL视觉布尔推理基准,含6000道是非题和1000道识别题,揭示模型准确率仅约50%。
NextMe-800:从数月第一人称视频中预测个人行为
发布约800小时、单人126天的第一人称数据集NextMe-800及预测基准NextAct,评估模型对个人行为的预测能力。
可扩展、可迁移的数据选择元网络需要一种不同的损失函数(以及为什么那个显而易见的选择存在问题)
提出TESS框架,以逐点价值匹配目标替代逐样本权重,解决优化不稳定与泛化差问题,实现跨数据集、跨模型规模的可迁移数据选择。
量化救护车滞留影响:维多利亚州急诊医疗服务病例的多年度分析
全州285万次救护车出勤累计损失149万救护车小时,2022年达峰,交接时长随同院前一小时到达车辆数递增。
面向可泛化深度伪造检测的交叉重建再审视
重新审视交叉重建,提出保留伪造痕迹多样性的解耦框架,结合掩码频率感知重建,提升深度伪造检测泛化性。