当错位成为监督:监督式合成CT生成中的结构化标签噪声
配准残差实为结构化标签噪声,误导监督合成CT;感知损失与解剖评估可缓解。
MORE-PLR:用于部分标签排序的多输出回归
用多输出回归解决部分标签排序:编码器将带并列排序转为回归目标,推理后处理层生成桶序,实验有竞争力。
ICE:面向多模态图基础模型的任务对齐 Clifford 潜在场
提出ICE多模态图基础模型,用Clifford潜场建模高阶交互,30项任务均第一。
基于确定性基础模型的轻量级概率降尺度
改进U-Net构建轻量级概率降尺度模型,确定性预训练加概率微调,RMSE超越最优,兼顾效率与分布拟合。
GeoRefer-Bench:从指代像素到可验证地理空间推理的基准
GeoRefer-Bench以可执行逻辑形式和精确查询成功(EQS)评估地理空间指代分割,揭示模型关系推理短板。
推理总是有用吗?重新审视通用多模态嵌入中的推理效用
研究发现推理增强的多模态嵌入常出现"假有益":推理反而拉近难负样本;据此提出SURE路由,免重训即提升检索性能。
CORDIAL:从少量标签校准序数型LLM输出
将LLM输出视为真实标签的含噪读数,用五参数通道校正,仅需少量标签即可校准,多数设置下对数损失最低。
UNWIND:面向压力检测的任意长度面部视频——无需时间分窗
将完整面部视频的时间维折叠为通道维,无需分窗即可整体检测压力,准确率达70.02%。
面向低资源语音识别的自适应Fisher白化交叉协方差
提出自适应Fisher白化交叉协方差,以任务感知子空间和自适应秩分配提升低资源语音识别参数效率。
ERRAND:智能体记忆的预算化维护
ERRAND将记忆复核视为有价差事:按动作价值定价,仅在收益超过成本时复核,克制重验优于盲目更新。
HiPACE:稀疏自编码器中特征吸收的分层相界分析与受控评估
提出闭式相界λc(k,α)与HiPACE协议,在SAE中验证特征吸收,并证明家族子空间因果充分性。
直接消息近似(DMA):基于一致性的因子图可处理近似推断框架
DMA直接近似因子到变量消息,基于一致性,避免内循环与负精度,用于贝叶斯神经网络推断。
裁剪随机梯度下降的精确收敛速度
重新分析裁剪梯度下降,在(L0,L1)光滑下给出更紧收敛界,放宽步长至η<1/β,并降低最终损失。
导航世界模型的视觉表征与历史建模
比较五种冻结视觉表征,提出缓存线性与平衡GDN架构,减少历史冗余计算,实现高效长上下文多查询预测。
面向物理智能体的技能安全退役
技能退役若仅凭任务基准,会漏审安全条件,导致未授权物理与隐私效应;须用双门控证书审计权威契约。
VietPrism:一个具有多样方言与语码转换的大规模越南语语音及深度伪造语料库
大规模越南语语音与深伪语料库,涵盖方言和越英语码转换,含993.4小时真实及3.1K小时伪造语音,暴露检测模型脆弱性。
AdaPilot:面向跨生成器文本到图像质量优化的场景自适应策略学习
提出AdaPilot,用端到端强化学习获得场景自适应、跨生成器可迁移的文生图质量优化策略,可零样本迁移。
跨模态情感理解:一种用于对话情感识别的Transformer-GAT方法
提出Transformer-GAT框架,融合全局语义与模态细粒度关系,跨模态情感识别性能达最优。
编码了却未解码:LLM句法三级差距的层局部化证据
提出行为、LM头、探针三级评估:探针可恢复性≥读出≥行为,差距源于主语控制,指令微调加剧。
顺序知识编辑会破坏模型辨别证据好坏的能力,却不损失准确率
顺序知识编辑不损准确率,却削弱模型辨别证据可信度的能力,并拖累检索与选择性预测
噪声评分下面向隐私与稳定的列表推荐解耦学习与选择
将列表推荐解耦为随机评分学习与确定性选择,界定隐私范围,并给出噪声评分下排序稳定的边际证书。
MILO:基于块级低秩压缩的高效多样本上下文学习
提出MILO,按块级低秩压缩KV缓存,依信息熵动态分配秩,内存降50%、吞吐提升1.8倍,性能几乎无损。
SPADE-DFL:通过无导数线性化ADMM实现通信高效的去中心化联邦学习
提出SPADE-DFL,以无导数线性化ADMM降低去中心化联邦学习通信,兼顾收敛与差分隐私,实验精度更优。
文化差异保留:诊断大语言模型模拟调查人群中的扁平化与漫画化
提出文化差异保留指标CDP,基于一次性人工校准,识别跨国差异缩小(扁平化)或放大(漫画化),揭示传统保真度指标与CDP的系统性偏差。
PEEL:面向CT成像中可辨识不确定性的物理赋能证据学习
以物理噪声确定NIG似然不可辨识纤维,冻结网络后用蒙特卡洛教师学偶然方差,CT不确定性预测相关0.83–0.95。
基于上下文化词表示的多任务学习用于形态丰富语言的句法分析
面向形态丰富的乌尔都语句法分析,提出基于上下文化词表示的多任务学习,显著提升成分与依存句法分析性能。
你的Transformer能同时容纳两种思路:大语言模型中线性叠加的证据
LLM呈线性叠加:输入线性组合时输出叠加各下一词分布;此源于架构,可微调恢复,单次前向生成两段续写。
PartHackBench:面向部分得分工具智能体评估的认证等进度压力测试
该基准用私有认证器对齐轨迹状态与归因,仅在事后测分数膨胀;进度固定下检验部分得分评估是否被钻空子。
BLADE:用于校准知识图谱补全的蒸馏大语言模型正则化
BLADE将离线大语言模型判断蒸馏为冻结教师正则,推理无需LLM,提升知识图谱补全校准,仅限声明候选分布。
布朗核阶梯的公共协方差几何与认证
引入最小迹公共协方差,支配布朗核阶梯经验并集,统一核适应、高斯几何与可认证计算。
星载差分摄影测量:面向大梯度形变的无控制测量,兼具结构免疫性与可预测精度包络
将星载光学重复影像相关建模为无地面控制的差分估计,提供可预测精度包络并减少对稳定地形依赖,实验验证。
CataOPD:面向大语言模型推理的催化式同策略蒸馏
提出CataOPD,让教师充当催化剂而非目标,经自助路由、催化引导自解与障碍加权内化,把学生自产轨迹固化为无催化策略,提升推理与泛化。
CoSWA-YOLOv12:尺度不变的疟原虫微小目标检测与分割
将Wasserstein分配按目标尺寸反比路由,配合小波残差与M2-NWD损失,提升疟原虫分割召回。
ChunkRank:面向LLM流水线的模型感知文本分块与弃权感知答案选择
ChunkRank开源库按模型分词器与上下文窗口分块选答,实验显示内容排序难胜首个非空答案,因阅读器弃权。
任务感知谱剪枝:面向高效大模型推理的混合掩码框架
提出TASP框架,按任务校准路由谱剪枝掩码,减43%算力仍保97.7%性能,解码提速1.44倍。
PROVE:面向医学视觉问答幻觉检测的证明引导、机制感知算子验证
PROVE按问题证据结构分三类验证机制,动态激活加权五种算子,输出校准风险分,AUROC达0.821。
iCoder-27B:递归式AI主导研发的前沿工业级编码模型
AI借专家技能自主迭代训练,产出27B工业编码模型iCoder,RTL等基准超越GPT-5.5。
摄取期事实编译:面向修订语料库的低成本可靠问答
摄取期编译事实、一次性解决修订与来源规则,查询时读取编译记录,低成本模型更准且读取成本降约13倍。
面向多任务学习的样本加权端到端迹范数几何
提出样本加权端到端迹范数几何,精确推导经验拉德马赫复杂度,实验证明加权联合核正则提升多任务泛化。
面向长文档问答的VLM流水线实证研究
长文档问答VLM流程实证:代理收益依模型规模,检索模态比检索器关键,图像检索省词元,多流程互补。
谱引导扩散:通过静态谱层调度加速推理
提出谱集中率结合Frobenius范数离线调度残差缓存,免路由校准,保持质量并加速2.8–3.0倍。
CATCH:基于条件Haar扩散的反事实解剖组织修复
CATCH在Haar小波域以条件3D扩散修复脑MRI肿瘤区,加权混合掩膜在BraTS验证集最优。
基于显式条件一致性引导与长尾自适应流匹配的精确多模态人脸合成
显式条件一致性引导结合长尾自适应流匹配,提升多模态人脸合成语义对齐,稀有属性掩码准确率提高29.38%。
QINA:面向预训练视觉模型的量子启发式非线性适配器
提出量子启发非线性适配器QINA,用可学习三角提升与有界聚合增强冻结预训练视觉模型,优于通用适配器。
思考还是不思考:把推理分配到真正有帮助之处
提出CARE方法,用在线采样对比各题长度调整的收益,在GRPO中自适应分配推理长度,准确率最高提升4%且推理长度减少37%。
面向金融服务的领域自适应检索增强生成式自动合规问答
领域自适应检索将Recall@10提至0.774,但小模型生成的增益未证实有真实依据。
C3M:面向长时程任务的跨会话多模态记忆维护
C3M以有界索引组织跨会话图文证据,经关系感知更新与预算路由保留来源与时间区分,支撑长时程推理。
解码想象语音:一种严格独立于被试的EEG方法
严格跨被试框架下比较EEG想象语音解码的时域统计与频域谱功率流程,后者平均准确率显著更高(49.03%对37.97%)。
像我们一样公平吗?审计资源分配中大语言模型的对齐
提出评估大模型公平推理的通用方法,发现其比人类更严苛自利、受信息框架影响,且难以微调对齐人类判断。
人工社会基准:合成研究的验证框架
提出人工社会基准,用11项测试检验合成人群效度:模型回答过于一致、压缩量表,单域可信难代表整体。