学习频谱分配:面向自适应体数据分割的分数阶扩散框架
提出FHEAT分数阶扩散,优化自动分配各阶段频谱混合;算子退化为恒等,FLOPs降79%,半监督分割领先。
学习对未观测混杂因素稳健的风险评分
提出未观测混杂下稳健风险评分学习法,以逆倾向加权为基础,融合敏感性分析与分布鲁棒优化,提升校准。
UniDataAgent:面向企业问报到报告自动化的本体驱动智能体
本体驱动的企业问报到报告智能体,语义构建与执行分离,构建周期由一周缩至数小时,严格准确率95.0%,远超文档RAG的72.5%。
从单曝光RAW序列重建高动态范围视频
提出RawHDRV端到端框架,利用Bayer线性响应与通道特性实现单曝光RAW视频HDR重建,并构建大规模数据集,性能达最优。
用于有向船舶检测的条带卷积与方向感知排除损失
提出条带卷积模块与类别-方向感知排除损失,兼顾长船体特征提取与重复预测抑制,仅2.91M参数。
面向耗散系统的数据驱动离散时间深度循环神经网络建模
提出离散时间耗散循环神经网络DissipNet,通过结构约束和训练算法显式保证耗散性与稳定性,优于RNN和PINN。
把信用归于应得之处:面向高效推理的冗余感知学习
提出RECAP,以结构责任和步骤效能做冗余感知信用分配,重塑GRPO优势,提升推理准确率并减少冗余。
洞悉关键:面向大规模推理的原则性上下文表示
基于关联实现原则提出R3Con,构建大规模上下文表示,显著超越基线,小模型亦可媲美大模型且成本更低。
打破天气-内容耦合:面向一体化红外复原的类型-严重度引导渐进解耦
提出TSGPD-IR,按天气类型与区域严重度渐进解耦,一体化红外复原,抑制伪影并保留热结构。
视觉语言模型能否分析以人为中心的视频?模型能力与人机协作工作流图谱
构建15项视频标注基准并比较人机流程:VLM独立接近人类,人验证VLM准确率最高且显著省时省钱。
LOCKR:一种用于检测与修复扩散语言模型中“稳定但错误锁定”的隐藏状态轨迹引导规划器
扩散语言模型易早期锁定错误答案,LOCKR以隐藏状态轨迹引导选择性推理修复,准确率提升2.21–5.37个百分点。
超越重叠:估计基准测试暴露的因果效应
LeakScale框架量化基准测试暴露因果效应,暴露使准确率提升7.17–27.31个百分点。
面向共形椭球的尾部感知几何学习
提出尾部感知共形椭球几何学习,解耦尾部敏感与覆盖保证,用CVaR约束学习并共形校准,权衡体积与尾部严重度。
ZO-COSMO:面向去中心化零阶优化的无索引单跳混合
ZO-COSMO提出无索引单跳混合,用两查询估计与保均值掩码共识实现去中心化零阶优化,在Qwen LoRA等任务提升精度。
几何条件化的自然环境视觉地点识别
提出深度感知蒸馏,把几何基础模型推断的几何注入视觉基础模型,无需深度传感器,提升视觉地点识别。
相遇、比较或弃答:面向知识格上确定性多跳问答的 LatWeave
将知识组织为多维知识格,把多跳问答编译为 meet、compare、abstain 三个确定性算子,答案生成零 LLM、可逐步复算审计。
序列推荐系统中时间归因可解释方法的系统性基准评测
提出双模型掩码指标,基准评测十种可解释方法;梯度法归因最忠实稳健,原始注意力不可靠。
基于电阻曲率的可扩展子图采样
提出ERC-LG电阻曲率近似法指导子图采样,在七个节点分类数据集上六个精度最优。
通过集成自验证与检索增强生成降低大语言模型幻觉
提出CoVe-RAG+,结合链式验证与检索增强生成,降低工程任务幻觉,事实准确率较基线提升28%。
不受控的变量:视觉语言模型的拒绝行为随图像是否存在而变,风险无法解释
空白图像即使VLM拒绝率波动数十点,且仅波及临界良性提问;该行为与风险脱钩,系随权重继承的未受控变量。
用户生成文本的音素化:基准、分类体系与组合方法
发布首个英越韩用户生成文本G2P基准UGTPhon及分类法,用规范形式组合解码缩小性能差距。
MGRL-RSCC:面向细粒度遥感变化描述的多粒度奖励强化学习
提出多粒度奖励强化学习,结合双解码与两阶段优化及三种奖励函数,缓解曝光偏差,提升遥感变化描述质量。
污损智能体间通信下基于策略的选择性再生成
ESC-CR分离主张与授权,在释放边界执行语义承诺;违规时污染消息、重建洁净上下文再生成,抑制未授权输出。
拒绝却不加区分:编码提示对安全训练模型做了什么
编码攻击评测只看有害样本,掩盖模型区分能力;四模型同形字编码下拒答差异消失,后训练亦无法修复。
观察生成式AI支持下的系统综述实施:一项软件工程研究生课程的经验报告
十名博士生分组在有/无生成式AI支持下试点系统综述:AI降低门槛、暴露方法问题,但易致过度委托与浅层验证。
GaussPDE:面向3D高斯泼溅的基于图的偏微分方程驱动渲染
提出GaussPDE,无需网格、体素或重训练,向3D高斯注入PDE动力学,实现稳定可控、空间连贯渲染
StepTrigger:面向VLM驱动腿式机器人的接触状态触发后门攻击
提出StepTrigger:利用足地接触压力触发VLM腿式机器人后门,可保持正常并拒绝误触。
Transformer 语言模型中的序列计算蒸馏
用轻量合并模块将多词元压缩为代理嵌入,推理时缩短序列最多40%,精度损失小且无需重训。
无配对集合何时支持共享损坏校准:矩几何与双样本精度
面向共享损坏的无配对校准,提出两样本矩校准与秩感知信息状态,实现平面相似校正闭式识别,并报告弱信息而非硬拟合。
无声的破坏:内部状态触发的LLM驱动机器人系统后门攻击
首次揭示LLM机器人系统的历史触发后门:由机器人自身动作序列激活,攻击成功率近100%且极难检测。
TTTIR:通过测试时训练解锁图像恢复的实例特定状态演化
提出TTTIR,将图像恢复建模为实例特定状态演化,结合渐进状态生成与状态转换演化,性能优于现有方法。
ChipMEM:面向 EDA 智能体的验证锚定记忆
ChipMEM为EDA智能体提供验证锚定记忆,融合跨任务技能与贝叶斯指导,仅存验证通过技能,提升RTL并迁移未见任务。
超越均值对照:审计冻结CLIP区域解释中的最差对照特异性
冻结CLIP区域解释:区域通过重叠与均值对比后,多数仍不敌最强竞争类;替代修复有限,受容忍度制约。
AraGenre 2026:分层定义引导的阿拉伯语体裁分类共享任务
AraGenre 2026设分层定义引导阿拉伯语体裁分类,零样本标签泛化,最佳分层宏F1为0.7352,细粒度分类仍难。
S2A:面向免对齐RGB-T显著目标检测的语义到空间对齐
提出S2A框架,先语义交互后空间校准,缓解免对齐RGB-T显著检测的错位特征污染,性能领先。
超越平衡准确率:面向无人机电力线路巡检中视觉语言与纯视觉缺陷评估的分辨率与对等性受控基准
构建ElecVQA-Bench受控基准,审计六项评估变量,发现视觉语言模型在无人机电力线缺陷评估中无稳定优势。
fMRI 基础模型的规模缩放研究
万级GPU时实验显示,fMRI基础模型缩放需协同数据、模型与训练时长,算力本身不足以决定性能。
生成式视频压缩的信息容量:量化同等质量下的码率—算力交换
提出信息容量指标,量化等质量下码率与解码算力的交换,14B解码器效率约是1.3B的十倍。
混合高斯表示:面向鲁棒开放词汇3D分割的多视角物体关联与边界细化
提出混合高斯统一3D表示,联合多视角物体关联与语义对比学习,并优化边界重建,LERF上mIoU达59.1%。
面向稀缺数据的谱连通性先验图学习
提出SCoGL,以拉普拉斯谱连通先验增强GLASSO,在稀缺数据下改进图恢复与图信号去噪。
注意力路由早期即趋稳定:面向循环语言模型的工作集推理
注意力路由在循环深度中早期稳定;WISE前期全局注意力、后期复用稀疏工作集,基本保持质量并提速。
规划式测试时扩展与协同推理路径
提出PTTS,以规划器生成大纲引导分支走向不同推理路径,替代独立采样,显著提升数学推理性能。
空间不可见,时间可见:面向GUI智能体的运动视觉CAPTCHA
运动视觉CAPTCHA靠时序分离隐藏语义;600例基准中人类99.6%,最佳GUI智能体16.8%。
发现、证伪、修正:审计智能体发现细胞模型中从源代码到预测贡献的输入使用主张
提出CELLAUDIT审计输入使用:高预测性能未必依赖扰动,证伪修正可恢复贡献。
面向越南劳动法的跨语言法律问答:检索、翻译与验证器引导的纠正
构建越南劳动法双语问答评测集,发现密集检索优于稀疏与混合,验证器引导纠正仅提升引用保真度。
面向在线自适应的贝叶斯神经网络全协方差平滑
提出全协方差贝叶斯神经网络平滑法,突破对角协方差限制,实现在线自适应且更准确。
沉默与重叠皆非失败:全双工语音对话模型中话轮转换的意图条件化评估
提出TACT基准,按说话人意图评估全双工话轮转换,与人类判断相关性0.81,优于二值指标。
CereVLA:受小脑启发、后果感知的残差治理,实现高效视觉-语言-动作执行
提出受小脑启发的CereVLA,用流残差修正并预测后果,抑制不利校正,提升VLA执行成功率与效率。
将预训练大语言模型改造为高保真连续文本自编码器
提出LLMAE,借预训练LLM内部激活构建定长连续潜瓶颈,实现近完美文本重建,并可支撑潜空间扩散图像描述。
MORSE:基于逆向评分的多上下文排序,实现证据保留压缩
提出MORSE方法,通过逆向评分调整上下文顺序,缓解信息抢占,提升证据保留与多跳问答效果。