延迟且被修订结果下的下行受控在线预测组合
延迟修订结果下,在线组合冻结预测器与校正器,仅用成熟损失控下行:最差劣化0.15%,收益11.5%。
最后的人类关卡:面向治理自动化的前线部署工程
提出数字治理任务替代框架:明确智能体替代人工审查关卡的条件,并以基准验证其可行性。
超越简单的输入-输出评估任务:利用自动化编程评估应对非平凡课程
将机器学习问题构建为输入-输出评估任务,使自动化编程评测工具有效支持AI教学,促进理论与实践结合。
视觉语言模型的域重定心与置信度加权先验校准
提出免训练CLIP校准法DRC,经高斯混合重定心与置信度加权先验校正,跨域精度最高且优于零样本。
BridgeMem:用于时序知识图谱预测的因果成对转移残差
BridgeMem通过为冻结预测器加入查询实体与候选间成对历史转移的因果残差校正,在五个基准上一致提升MRR和Hits指标。
FB-GDM:基于无监督变分推断的高维线性逆问题全贝叶斯引导扩散模型
FB-GDM用无监督变分推断实现全贝叶斯引导扩散,免调参,仅需观测和算子,高维线性逆问题中优于ΠGDM且更稳健。
双曲多模态持续学习:一种最近容许解
提出HMCL,将保持旧多模态几何化为共享双曲等距,用最近容许校正修正更新,显著减少漂移并提升性能。
纵向视野的深度学习预测青光眼进展速率并识别快速进展者
GLAM深度学习模型仅凭纵向视野序列即可预测青光眼进展速率,识别快速进展者AUC达0.990。
语言特异性与领域多样性:面向孟加拉语医学命名实体识别的Transformer基准评测
孟加拉语医学NER基准:XLM-RoBERTa微调最优(F1 0.5959),多语模型优于语言专用模型,提示法远逊。
基于可解释神经网络的协同DCT图像去噪极限研究
提出可微架构DeepBM3D,融合非局部分组、DCT域维纳滤波与多阶段细化,超越经典基线,重复纹理表现尤佳。
Baszta:面向数据的波兰语多标签安全分类器微调
微调波兰语多标签安全分类器:微F1略优,但基准97%为犯罪类,宏F1才具判别力;OOD实为校准问题。
SEE Challenge 2026:宽光照范围内的事件引导亮度调整
赛事用SEE-600K评测宽光照事件引导亮度恢复,PSNR排名,15份提交;极暗下各系统仍见误差。
办公规模验证搜索中的算子包、提议器强度与构造族平台期
验证搜索2³因子实验:算子组合缩小差距、排斥增多样性且无正向交互,前沿提议器更强,构造族提示致平台。
学习一种面向自监督表示的流
提出非对抗FBDM,以球面条件速度回归学习自监督表示,近DM且提速1.48–1.83倍,有理论保证。
用于胸部X光器械推理的临床知识图谱
构建不确定性感知临床知识图谱,表征胸片器械实例、尖端估计与置放评估及证据溯源,奠定可复现AI推理基础。
可穿戴心电信号质量评估:一种深度学习与动态情境感知方法
提出基于深度学习的心电质量评估模型,区分清洁与噪声信号,跨数据库表现稳定,并结合情境数据解析复杂噪声。
面向复杂肺癌开放性决策的可审计条件策略框架
MCE将肺癌决策的候选路径、关键未知与安全约束组织为可审计条件策略,显著提升医生策略的临床适用性。
DP-IPI:面向临床文本中间接个人标识符的混合差分隐私文本改写机制
仅对含间接个人标识符的片段做差分隐私改写,降低临床文本重识别风险并保持连贯可用,优化隐私-效用权衡。
延迟满足作为长时程大语言模型的多智能体生存微观基准:社会暴露、人格设定与工具使用预算
借鉴棉花糖实验构建多智能体微观基准,以生存分析量化LLM长时程延迟满足与工具使用行为。
AgriCountDINO:面向农业的参数高效示例引导计数与定位
AgriCountDINO以示例引导、仅8.4M参数实现农业目标计数与定位,三样本MAE 11.92,零样本MAE 14.25。
LLMersion:面向教育公平的低成本家庭语言学习本地优先AI智能体框架
提出本地优先开源AI智能体LLMersion:用小型模型与自有文档在家练四技能,低成本促教育公平。
只需问Jev:面向校准决策的强化学习作为AI对齐失败的零样本检测器
Jev单次调用输出校准概率,零样本检测十类对齐失败,中位AUROC 0.886,成本低63倍。
基于不确定性感知视觉Transformer的多民族近视与非近视人群青光眼检测:一项多中心模型开发与验证研究
ViT模型基于5.6万张眼底照片,经16个跨国数据集验证,青光眼AUROC最高99.6%,高度近视下优于医生。
超越特征可靠性:重复感知的多重分形曲线回归用于脑龄预测
提出重复感知多重分形曲线回归RMCR,联合建模曲线结构与重复扫描变异,兼顾脑龄预测精度与个体内一致性。
RD-JEPA:面向跨反应扩散方程少轨迹迁移的预测性潜变量预训练
提出RD-JEPA,在五个参数化反应扩散系统上自监督预训练,仅需少量轨迹即可高效迁移至新系统,性能优于多个基线。
加纳语言青少年健康传播中自动语音识别(ASR)的基准评测与领域自适应
加纳三语ASR基准评测与微调适配:Ewe词错误率由109.3%降至64.8%,瓶颈在域内数据。
LLM智能体多轮一致性评估:生存分析与失败理由分类学
通过生存分析与失败理由分类,揭示LLM智能体多轮不一致的时间规律与模型特异失败指纹。
面向视觉语音识别的姿态自适应动态FiLM调制
提出姿态自适应动态FiLM框架,DR-FiLM动态预测权重调节调制强度,显著降低音素错误率。
SWE-Prometheus:衡量真实世界代码仓库中的工程治理改进
提出SWE-Prometheus基准,从六维度衡量代码仓库工程治理改进,兼顾行为保持与证据质量。
面向12导联心电图分类的混合CNN—状态空间—注意力主干网络与联合嵌入预测预训练
提出混合CNN-状态空间-注意力主干与JEPA隐空间预训练,提升12导联ECG分类及少标签迁移性能。
自信却错误:面向低资源自动译后编辑的受限解码诊断法
提出免重训的推理期诊断法,通过编辑距离惩罚曲线区分低资源译后编辑的失败模式:二元坍缩与自信误校准。
通过自组织的在线任务适应
元学习神经细胞自动机实现无梯度在线适应:固定慢参数,仅靠局部误差驱动快速记忆更新即可提升新任务表现。
随机语义证据图:面向智能体 AI 的不确定性传播与治理
提出随机语义证据图,量化不确定性来源、传播与输出可用性,辅助治理。
论脉冲神经网络的二阶优化
提出二阶优化器SpiKFAX,以Kronecker分解近似Fisher矩阵,提升SNN精度与稳定性。
TTLab在StanceEval-2026:面向阿拉伯语立场检测的完形填空式提示方法(CLASP-Ar)
将阿拉伯语立场检测重构为完形填空式掩码语言建模,通过受约束标签词表预测,避免多任务学习复杂性。
智能游艇码头试验平台中面向场景特定船舶检测的帧到全景定位与上下文感知采样
提出帧到全景定位与上下文感知采样,4万帧减至220张,微调YOLO26-m船舶检测AP50达94.78%。
基于可微仿真与辐射场分解的超声成像阴影抑制
RFlash可微辐射场分解超声图像并重渲染抑制声影,改善胎儿脑评估,无需原始数据或硬件改动。
JEV 与 LLM 作为评分标准裁判:更便宜、更快,且在同样地方出错
JEV比LLM评审便宜29–325倍、快30–220倍,准确率相近,但错误高度相关,级联增益甚微。
PPTBench:编码智能体能否通过结构化、可编辑的幻灯片重建视觉世界
PPTBench:以可编辑PPTX重建论文流程图,500任务;最佳仅67.80分,视觉语义还原仍难。
BiGraph-Diffuse:面向心理健康咨询的图结构检索双向扩散语言模型
提出心理咨询扩散语言模型BiGraph-Diffuse与图检索BiGraph-RAG,强化双向理解与临床推理,实验和理论验证有效。
TimeBraid:统一时间序列与语言以实现理解与预测
提出TimeBraid统一模型,通过交错注意力对齐语言与时序基础模型,兼顾理解与预测,性能媲美更大通用模型。
TinyCardioUNet:基于图编码轴间依赖与张量分解参数压缩的IMU到ECG转换
轻量UNet联合六轴IMU,经图神经网络编码轴间依赖、张量分解压缩参数,仅3.6万参数实现高精度ECG重建。
面向时间序列分类与预测的神经化多小波分解
提出神经化多小波分解框架m-WCN,联合提取时频特征,构建TFBC分类与FTB预测模型,实验平均提升约20%。
密集覆盖,稀疏精修:字节受限的协同感知
提出覆盖-精修协同感知:全图粗传加高价值区域精修,按需分配比特,1.87KB下达0.60 AP。
面向阿尔茨海默病检测的在线手写片段级风险发现
提出NormPaST-Risk,用片段级风险发现实现可解释在线手写AD检测,DARWIN上性能领先。
基于滑动窗口方法的命名实体识别
提出免重训的滑动窗口推理流水线,将句子级NER模型扩展至文档级,避免边界碎片化,F1最高0.8902。
过时并不意味着不安全:基础设施状态竞态下工具调用型LLM智能体的守卫精度
区分失效竞态与无关竞态:新鲜度守卫误挡92-95%良性竞态,仅语义谓词守卫零误挡,模型自评不可替代。
FlowAtom:面向多标签网站指纹识别的基于原子的证据聚合
无需标签构建原子原型,跨流聚合证据识别混合加密流量中的监控网站集合,最高F1达97.82%。
基于视觉潜空间缺陷锚定推理的工业异常检测
Anomaly-LR于视觉潜空间做缺陷锚定推理,构建IAD-LR-22K数据集,无需外部工具即达最优。
神经传输嵌套采样
融合嵌套采样与神经流,估计分子配分函数;55粒子团簇误差降一个数量级,单次输出温度分辨配分函数。