基于纠缠引导与代理约束缓解大语言模型遗忘中的过度遗忘
提出EGUP框架,用样本间/内纠缠动态调整遗忘强度,并以代理约束软正则化,缓解过度遗忘,改善遗忘-效用权衡。
《匹诺曹:面向黑盒语言模型的快速不确定性估计》
Pinocchio 是一种外部校准器,无需访问 logits 或微调,仅一次前向传播即可预测黑盒 API 模型回答的正确性,并可零样本迁移至未见模型。
超越诗歌:大语言模型能否生成古典阿拉伯玛卡梅?
首次受控评估大模型生成阿拉伯玛卡梅,人评与大模型评判;少样本提升韵文密度,零样本总分最高。
自主科学发现中的虚假科学诱导
合法对象与测量错配使神经代理学习虚假关联;误差一致性而非频率致实验预算错配;监测轴隔离可拦截。
ELEMENT:基于最大熵的分幕式与终身探索
提出 ELEMENT,融合终身与分幕熵最大化,用 kNN 图估计熵,提升状态覆盖与无监督预训练。
FedNIA:面向联邦学习数据投毒缓解的噪声诱导激活分析
提出FedNIA,无需中心测试集,注入噪声分析客户端激活,检测排除恶意客户端,抵御多种联邦学习投毒攻击。
激励与切割层选择如何影响拆分联邦学习中的数据贡献?
用Stackelberg博弈分析拆分联邦学习中激励与切割层选择对数据贡献的影响,均衡可最大化双方效用。
TEEP-RCNN:基于Faster R-CNN中改进卷积块注意力的纹理增强边缘感知钢材表面缺陷检测
提出TEEP-RCNN,改进CBAM与TTA+WBF,NEU-DET十轮达73.3%mAP@50。
TEMPURA:面向动作推理的时序事件掩码预测与理解
TEMPURA提出两阶段训练框架,通过掩码事件预测与视频分割标注,显著提升视觉语言模型的视频时序理解能力。
OV-MAP:面向机器人的开放词汇零样本3D实例分割地图
提出OV-MAP,融合开放特征与2D掩码投影,实现机器人零样本3D实例分割。
基于偏好向量的自适应有用性-无害性对齐
提出偏好向量框架,训练单项偏好模型,提取行为偏移并在测试时动态合并,实现可控可扩展的有用-无害对齐。
WebArxiv:面向arXiv任务的多模态网页智能体可复现评估基准
提出WebArxiv基准,含510个静态可复现任务,评估发现现有网页智能体在学术检索与推理上仍具挑战。
检验而非预设充分性:依据涌现网络结构校准生成式社会模拟器
提出充分性校准协议,发现生成式社会模拟器在二手奢侈品市场无法复现关键网络结构,修复未恢复充分性。
跨量表迁移学习用于抑郁严重程度预测:跨语言与临床范式的从PHQ-8到HAMD-17
提出序贯LoRA跨量表迁移,由英文PHQ-8迁移至中文HAMD-17,数据稀缺下预测指标优于单目标训练与基线。
相对放电阶段(RDS)分类:一种实用的电池放电进程指标
提出相对放电阶段(RDS)指标,用五类可解释等级表征剩余放电状态,结合SOC估计与轻量时序网络分类,准确率超80%。
从变化描述到变化检测:面向遥感变化检测的语义-外观一致性框架
变化描述引导遥感变化检测,语义-外观一致性框架融合语义与RGB差异定位变化,免人工掩码。
质量胜于数量:基于特征工程的非法比特币资金流半监督检测
构建半监督框架检测比特币混币非法资金流,证明效果取决于特征质量而非数据量,高保真特征F1达0.84。
智能体编辑式世界模型:重新思考LLM智能体的世界建模
提出AEWM,以动作评判与状态修正编辑噪声轨迹,直接改变后续决策状态,提升LLM智能体表现。
冲突专家意见的可靠融合
提出概率电路融合框架,依上下文可信度整合黑盒专家意见,无需重训,提升多选问答性能与冲突下可靠性。
EnSIMem:面向长期智能体记忆的实体结构化索引
提出实体结构化长期记忆EnSIMem,离线建实体-属性索引并保留来源,在线检索证据,准确率高且上下文紧凑。
对比学习用于作者身份验证
对比学习在作者验证任务上优于分类方法,所提ModernBERT双编码器模型在PAN21上准确率达98.4%。
Text Scores Can Miss Waveform Use: A Qwen2-Audio Quantization Case Study
小线索,大后果:学习关键线索用于多模态表情包分类
提出MemeCF基准与MemePIVOT模型,聚焦关键线索的局部-全局对齐,提升表情包分类鲁棒性。
Diff-RF:基于退化感知学习的互增强图像配准与融合
提出退化感知互增强扩散框架,耦合配准融合与信息恢复,提升复杂退化下配准精度与融合质量。
ODPure:基于集成式损坏共识的目标检测后门净化
提出ODPure,以集成式损坏共识实现目标检测输入阶段黑盒后门净化,防御多种攻击并保持精度。
哪些目标需要一个调节旋钮?——可操控多元对齐中的目标冲突预测与权衡覆盖
两项预训练指标可预测人类标注目标冲突,AI标注受长度重复干扰;模型选择与参数合并可扩权衡覆盖但不及直接训练。
ContraVis:面向法律合同矛盾审查的基于证据可视分析
构建合同段落类型图,融合引用与语义关系,以图约束LLM推理并支持交互审查,助律师验证矛盾。
从对齐到融合:三维视觉语言
提出“先对齐后融合”框架,用成对余弦对齐和正交映射融合点云、体素、多视图特征,多项3D视觉语言任务性能提升。
比房间更安静:语音编码器的表征漂移与任务鲁棒性
八种冻结编码器在四类任务上显示,非语音干扰可致表征漂移,且漂移与任务损失相关;但漂移更大未必损失更大。
中心偏倚会传播吗?病理基础模型在全切片图像分类中的鲁棒性
评估六种病理基础模型在全切片分类中的中心相关鲁棒性,提出AUCC;中心偏倚会传播,ComBat增益不一致。
I-SplineFlow:为少步生成学习单调样条随机插值调度器
提出I-SplineFlow,以积分单调样条参数化随机插值调度器,解耦次数与权重数,改善少步生成FID且训练快。
EmbodiedMemory-Bench:面向长时程具身任务的具身记忆基准评测
提出EMem-Bench基准评估长时程具身记忆,并给出外部记忆系统与8B策略,模型记忆能力仍普遍薄弱。
两个全局裁剪足矣:定位DINO式自监督学习中的语义涌现
DINO式自监督学习的语义表征主要源于同一图像不同全局视图间的一致性对齐,掩码目标仅细化既有结构。
深度引导的对比学习:让2D表征具备3D空间感知
提出DGCL,用深度将3D邻近关系转为对比相似度,以相对距离比较注入空间感知,提升2D表征及下游任务。
CAVEAT:迈向激励错位环境中稳健的计算机使用智能体
提出CAVEAT基准,揭示智能体在激励错位环境中易偏离用户目标,干预可提升55%。
当准确率差距无法认证:审计LLM评判器的跨域重校准
审计13个裁判、8域、1176次迁移:准确率差距与重校准失败弱相关,不能作部署认证,目标域校准更优。
遥感图像有向目标视觉定位的统一框架与数据集
提出遥感有向目标视觉定位统一框架O²-VG及数据集DIOR-R-RSVG,兼容判别与生成模型并提升性能。
线性RNN缩放定律:当更长序列胜过更多序列
线性RNN师生模型揭示缩放律:谱交叉下更长序列抑制初始化瞬态,序列数与长度不再完全可互换。
从心电信号到用于生物特征识别的代表性形态热力图
提出代表性形态热力图表示ECG,在三个数据集上平均降低EER 9.59个百分点、提升Rank-1 24.69点。
CS-WCP:面向组比例不确定的 LLM 评判器流量漂移的稳健共形集
为组比例不确定的LLM裁判流量漂移,以加权共形集并集提供覆盖保证;覆盖提升但集合偏大,重尾部保护。
一类低参数正交矩阵的黎曼结构与优化
研究块对角因子与固定置换交错矩阵的黎曼结构,提出正交双因子高效优化算法,用于矩阵逼近和大语言模型微调。
分布与规模:什么决定了测试时预算分配是否划算
决定测试时预算再分配是否划算的是负载内实例难度差异度而非平均难度;计入成本后仍能收回大部分收益。
面向惯性聚变能模拟的多智能体设计助手
构建多智能体设计助手,以自然语言驱动高阶多物理惯性聚变代码,自主设计靶丸,实现模拟点火。
基于文本保持技术的微调大语言模型数据溯源审计
以不可见Unicode字符构建"线索—回复"标记,黑盒审计微调数据使用,0假阳性下真阳性率达96.7%。
非线性上下文老虎机中可证明的随时集成采样算法
提出非线性上下文老虎机的可证明集成采样框架,覆盖GLM与神经模型,给出遗憾界、随时版本并实验验证。
动态生物相关环境中的实时自主磁性微型机器人导航
提出长程规划与短程反应控制闭环框架,实现磁性微型机器人在动态生物环境中实时自主导航。
以输入和输出维度为参数,二值量化神经网络训练是W[1]-难的
证明2-QNNT以输入输出维度之和为参数是W[1]难的;ETH下更无相应次指数算法。
基于分层约束的元模型引导模型生成
提出元模型引导的分层约束模型生成方法,协同生成时约束与生成后验证,在汽车电子实验中通过验收与校验。
STAR-VAE:面向可控分子生成的可扩展隐变量Transformer
STAR-VAE融合双向编码器与自回归解码器,经性质条件化与轻量微调,实现有效、新颖且可控的分子生成。
多模态大语言模型驱动的上下文感知无人机应急着陆点选择框架
提出融合遥感与多模态大模型的无人机应急着陆点评估框架,粗到细识别语义风险,构建ELSS基准。