出现不等于忠实:文本到图像生成中的喻体入侵
文生图中存在喻体入侵:喻体被误绘为可见物且跨语言持续;提出诊断基准、评分与缓解法。
SIMANF:通过归一化流中的模拟退火实现非归一化分布的无样本学习
融合模拟退火与归一化流,仅用非归一化密度、无需目标样本,逐步退火精修,缓解模式崩塌,学习高维多峰分布
CoLMbo-SV:面向可解释说话人验证的声学接地语言模型
提出声学接地语言模型 CoLMbo-SV,兼顾高精度验证与可核查比较报告,EER 0.99%,错误降约80%。
预训练数据投毒的可解理论:机制依赖的标度指数
可解投毒理论:干净性能幂律退化,非整数标度指数源于奇异结构,且指数依赖极限顺序。
FUND:用于采样非归一化分布的密度流
提出无需真实样本训练的密度流算法,迭代重塑目标分布,高效精确采样玻尔兹曼分布。
MA-FPPO:多智能体流匹配预训练策略优化
提出MA-FPPO,在线微调流匹配预训练的多智能体策略并以团队优势更新,平均超最强离线基线52.8%。
协同何时有助于主动特征获取?一项基于PID的研究
提出SynAFA,用PID分析协同信息:低预算下有益,高预算消失,且局部信息难转化为有效获取目标。
视觉-语言-动作模型对单步观测扰动是否鲁棒?
研究VLA对单步观测扰动的鲁棒性,发现性能下降且受动作块长度影响,提出低开销CARE动态选择执行长度。
ProTTT:以测试时训练学会学习语义用户记忆
以用户画像监督学习共享初始化,测试时训练将用户历史压缩为持续演化的语义记忆,超越基线且降低成本。
RoboSTAR:面向人形机器人的下一尺度自回归手语翻译
RoboSTAR:文本驱动手语生成框架,以部位量化与下一尺度自回归由粗到细并行生成身体与手部动作,可重定向至人形机器人执行。
校准而非答案选择:蒸馏推理模型的内部置信度
内部置信度校准优于答案选择;Probe-SD自蒸馏微调显著降低ECE,改善加权投票。
图像旁的文本:面向可信多模态医疗数据及更广领域的检测、效用与泄露
评估多语种医疗报告文本去标识化下的检测、效用与残余泄露,跨文档关联仍可重识别。
CUE-Mem:基于多模态对话中隐式线索的长期用户记忆评测
提出CUE-Mem多模态基准,含2674道题,揭示隐式线索的保留与检索是长期用户记忆的主要瓶颈。
LLMAdBench:面向大语言模型回复中广告投放的人类偏好基准
LLMAdBench:含1.8万人类判断,评测大模型回复广告位置偏好;前沿模型评判不可靠,微调有效。
论硬提示的能力与局限
首次证明硬提示存在性NP完全、最优NP难;短/长硬提示有本质局限,线性硬提示无;给出泛化紧界与充要条件。
基于过渡正则化的扩散模型持续数据遗忘
提出基于过渡正则化的持续数据遗忘框架,用固定容量转移记忆约束更新,平衡删除持久性与生成效用。
从位置风险到块存活:扩散语言模型的更快生成
提出BRISK-DLM,以风险奖励加权与前缀条件校正器优化并行生成,吞吐量提升37.4%且质量不降。
面向扩散语言模型的犹豫感知在线策略蒸馏
犹豫感知在线策略蒸馏将教师匹配扩展至所有掩码位置并按后见加权,无需额外前向,多基准最优且加速解码。
FSS-UBrain:多区域小样本脑肿瘤MRI分割
提出区域式单样本脑肿瘤MRI分割框架,在BraTS上对WT、TC、ET取得高Dice和低HD95。
EMIR²:演化感知记忆与意图引导的多轮检索
提出EMIR²框架,以状态演化记忆图结合意图引导多轮检索,长期记忆与冲突处理性能相对提升逾12%。
刷新还是实现?漂移模型中的算力分配
墙钟匹配时,刷新漂移场比加深拟合FID更低;重绘支持方向变化远大于参数更新。
OpenMASC:用于加速MRI中跨轨迹金属感知采样与校正的开源流程
开源流程OpenMASC:生成配对金属伪影MRI数据,校正网络与强化学习联合优化采样,适配多轨迹。
人工智能与人类科学家在理论构建中展现互补优势
比较人机理论构建:多数任务AI个体表现更强、理论更复杂;人类理论更简洁多样、聚合增益更大,二者优势互补。
BaatCheet:面向印度语言对话翻译的多语言语料库
多语言对话翻译语料库含约4.9万对话、5个方向;微调开源大模型显著提升,自动、LLM与人工评估。
让失败发声:面向智能体数据分析的可审计运行时
RADAR是可审计运行时,通过证据保留、类型化操作和运行时校验让智能体显式报错,多项基准显著提升。
FoundDSR: A Generalizable Foundation Model with Guided 2D Gaussian Splatting for Depth Super-Resolution
超维计算的叠加推理
提出SupHDC叠加推理范式,共享编码多个查询,速度最高提升2.08倍,精度损失仅2.67个百分点。
CHI:统一实体、关系与数量维度的摘要评估复合幻觉指数
提出CHI统一幻觉指标,融合实体、关系、数量三维度,与人类判断相关性最高,可分解、可解释。
Porimon:一种基于长/短期知识增强生成提升的大语言模型宝可梦对战智能体
提出LSTKAG并构建宝可梦对战智能体Porimon,融合长短时知识检索与伤害API,显著超越基线。
基于重嵌入网络的两阶段多视角步态识别
提出TFTR两阶段框架:孪生网络提取视角嵌入,Transformer重嵌入灵活融合多视角,两数据集准确率领先。
可解释的物理信息引导WiFi室内定位:学习有效的接入点几何结构并据此剪枝
物理信息解码器仅凭RSSI与标注位置推断AP几何用于剪枝;误差降26%–36%,剪去半数AP精度仍佳。
并非所有误差都重要:决策相关预测误差可预测规划质量
提出决策相关预测误差(DRPE),仅衡量影响决策的状态维度误差;实验显示其与规划成功率强相关,而总预测误差仅弱相关。
学习预测世界有助于智能体行动吗?——世界模型后训练审计
错配观测使预测精度降15.3%-61.6%,任务收益仍存;随机奖励也提升表现,增益非源于世界预测。
语言辨别能力提升多语言语音模型的语言学习
多语言语音模型预训练中强化语言辨别,可缩小与单语模型的差距,且首轮引入效果最佳。
排行榜能证明什么?面向生物医学文献综述智能体公平评估与训练的组合可控性
提出组合可控性,构建BioLitBench,拒绝11/21不可比比较,并训练SCRIBE获认证排名。
相空间注意力:Hairer 提升绕开单层归纳障碍
将注意力提升至辛相空间,绕过单层归纳障碍;不增参数、缓存不变,开销极低,并观察到归纳能力涌现。
HeroFrame-Bench:基于评分标准–排序协同演化的参考锚定评测,用于电影主视觉帧选择
构建HeroFrame-Bench,以参考锚定百分位与评分标准–排序协同演化评测电影主视觉帧选择,人机一致率升至83.78%。
流动中的骨架:面向人体运动预测的图结构流匹配
提出图结构流匹配,以时空骨架图与条件速度场生成未来运动并保持骨骼约束,AMASS验证且跨骨架泛化。
CertMark:具有认证解码的无失真多比特水印
提出CertMark:用消息种子精确采样保持原分布,支持认证弃权解码,保持文本质量并可靠恢复多比特消息。
一次感知,全部机动:面向机动级信号意图预测的方向性交通信号理解
提出方向性交通信号理解任务,从前视图预测直行、左转、右转、掉头各信号的通行性,方向级建模更优。
不完整训练数据下的主动特征获取
研究训练数据不完整时的主动特征获取,比较三种学习范式,发现缺失主要损害多步获取,生成式恢复可挽回性能。
面向多模态大模型区域到全局迁移的渐进视图在线策略蒸馏
提出渐进视图在线策略蒸馏,以填充裁剪为过渡,将学生视图由局部迁移至全图并加权监督,多任务平均准确率达77.51%。
SGA-Flow-GRPO:面向Flow-GRPO的空间梯度引导信用分配
提出空间梯度引导的信用分配框架,用奖励梯度构建连续空间信用图,辅以MAD鲁棒归一化,在GenEval上达SOTA对齐质量。
NLPG:面向自进化语言智能体的自然语言策略梯度
NLPG通过外部策略记忆,不改冻结智能体参数,将失败转为局部自然语言修正,六基准平均超基线8.71个百分点。
大语言模型信任“自己人”:多智能体系统中基于身份的从众行为
多智能体系统中,大模型从众行为随同伴身份变化:内群共识增强从众,外群共识削弱从众,与答案对错无关。
CUA-SWE:当计算机使用智能体遇上可视化软件工程
提出CUA-SWE基准,考察智能体借助截图与图形交互诊断、修复并验证软件问题。
契约记忆编译器:先解析,后遍历
CMC先抽取历史关系并解析更新,从问题实体遍历取证,多跳准确率达78.25%。
从场景图到答案:面向自动驾驶的选择性神经符号推理
提出查询自适应神经符号推理,符号优先、LLM补语义,提升自动驾驶问答准确率与效率。
当合并系数不再重要:面向持续LoRA适配的近端正则化合并
提出PRM:训练时加近端惩罚,使LoRA任务向量更易合并,拓宽合并系数平台、缓解稳定性-可塑性权衡。
RefCompose:基于LoRA条件扩散的多参考图像生成
RefCompose用固定参考画布与双流LoRA解耦布局和外观,实现恒定显存的多参考图像生成。