STA-TFM:面向姿态估计的跨视图时空聚合变换器
STA-TFM融合单目DSTformer与跨视图Transformer,实现多视图3D姿态估计,大幅降低关节误差。
空间动作审查:用于审计电子显微镜中语言到动作交接的可视分析仪表板
针对MLLM中答案正确却空间动作漏检的"静默失败",提出可视分析仪表板,联动记录与图像证据支持审计决策。
编码部分—整体层级结构的规范锁
提出规范锁原语,以高维相位差编码部分—整体层级,用自底向上/自顶向下神经场达热平衡,并关联心理旋转。
PACE-dLLM:基于置信度断崖估计的扩散语言模型弹性块解码
PACE-dLLM利用置信度断崖自适应前瞻窗口并独立提交阈值,解耦块解码,提速最高8.52倍且保精度。
基于视觉Transformer的相机空间精确手部姿态估计
针对相机空间手部估计的深度歧义与位姿耦合难题,提出变换同构监督、透视信息嵌入及帧率感知训练。
TransBERT:面向领域特定语言建模的合成翻译框架
提出TransBERT框架,仅用合成翻译文本预训练,即可在法语生命科学领域达到先进下游性能。
部分可观测条件下用于模仿的最小循环行为记忆
论文刻画部分可观测下模仿所需最小循环行为记忆,给出兼容关系与熵最小化,并验证学习码率接近零/二比特。
超越类别边缘分布:不冻结类别共现而界定回放间隔
提出RPR回放调度,界定回放间隔上界并保持类别均衡,ER-ACE准确率提升0.72–1.67个百分点。
跨党派指责:丹麦议会中的政治对比与责任归因
研究丹麦议会1997—2026年指责归因:近年上升,反对党更甚,右翼与极端化加剧,呈不对称硬化。
基于Frank-Wolfe的带约束自监督组合优化
提出基于Frank-Wolfe的框架,将网络输出分解为可行解稀疏凸组合,构造可微自监督损失并自动取整。
MECAIL:基于14.6 KB时空专家的通信感知目标检测增量学习
MECAIL实现通信感知增量目标检测,以14.6 KB时空专家适配基础模型,低带宽部署,性能媲美大参数量方法。
HySparse2:具有两级KV共享的混合稀疏注意力
HySparse2以两级KV共享稀疏注意力,跨解码KV缓存由自解码器生成,预填充提前退出,省算力与缓存。
基于自适应谱分解解耦异构交通动态的多步交通预测
提出ADNet,用可学习自适应谱分解解耦交通动态,双分支时空建模融合,显著提升多步交通预测。
激光雷达语言模型真的理解时空关系吗?
提出LiDAR-Hallu基准,揭示4D激光雷达语言模型时空推理失败,常混淆相反关系,聚合准确率具误导性。
MIGA:面向加速三维多回波MRI的共享几何高斯表示与隐式幅度建模
MIGA融合共享高斯几何与隐式幅度建模,仅用欠采样k空间重建,加速三维多回波MRI且性能更优。
长镜头帆板视频的身份一致性分析:一种领域专用的离线跟踪系统
提出离线帆板跟踪系统,检测并保守关联轨迹,以帆色和姿态驱动骑手相对虚拟相机,F1达0.937,优于OC-SORT与BoT-SORT。
AgentSTAR:基于智能体的单目视频形状跟踪与重建
提出智能体式分析合成,VLM渲染对比迭代优化,从单目视频重建跟踪3D形状,抗大运动遮挡,超越SOTA。
VPRune:高效免训练的LLM前视觉Token剪枝
免训练LLM前视觉Token剪枝框架,结合多样性选择、相似回收与位置保持,兼顾精度与压缩并降低边缘延迟。
ChainUQ:面向大语言模型的推理一致性感知不确定性量化
ChainUQ通过推理链一致性校准,提升LLM响应级不确定性估计,AUROC平均提升3.1%,ECE最高降低45%。
用对话上下文丰富语音情感表征
提出ACERT模块,利用可变长对话上下文捕捉情感演变,在多个数据集上超越现有方法。
基于函数复合的神经逼近:刚性与双指数收敛
函数复合神经逼近:分段线性生成器具刚性,光滑生成器迭代实现双指数收敛和深度分配误差界。
MAC-RRG:面向X射线放射报告生成的迭代式多智能体协作
提出MAC-RRG多智能体迭代框架,融合多源知识闭环优化X射线报告生成,减少医学幻觉并提升可解释性。
评估零样本时间序列基础模型的准确性与概率可靠性
评测六个时间序列基础模型发现:精度优于基线,但存在点精度与概率校准权衡,长短期校准表现因架构而异。
跨视图敏感信息差异引导的多视图公平聚类
提出跨视图敏感信息差异引导的多视图公平聚类,借助偏置排序非对称对齐与公平正则,平衡聚类质量与群体公平。
自然语言推理中的语义抽象:发现与补偿大语言模型语义知识与推理缺口的方法论框架
提出语义抽象框架,重构词义关系以发现并补偿大模型在自然语言推理中的语义与推理缺口,准确率提升超10%。
基于DWI时序深度学习的新辅助化疗病理完全缓解早期预测
仅用基线与首周期后DWI,时序深度学习预测乳腺癌新辅助化疗pCR,AUC达0.90。
融合分层认知过程与过程监督的可解释场景安全理解
融合分层认知过程与过程监督,构建过程标签数据集和LoRA/MoE框架,提升场景安全理解性能与可解释性。
你只需三分之二的所选专家:细粒度MoE大语言模型中动态专家剪枝的实证研究
研究12个细粒度MoE模型发现,保留约2/3的所选专家可维持98.8%性能,动态分配仅在激进剪枝时有增益。
跨文本片段审计基于代理的验证
评估分数常以廉价代理标签验证,但同片段共享表面证据会造成虚高一致;应跨片段重读代理、报告构念一致性并公开生成文本。
DTOC:面向AI智能体自适应上下文管理的动态工具输出压缩
DTOC将工具输出存于外部记忆,上下文留可逆占位符,按需还原,省token降本提效。
RankCert:模拟学习者何时能安全选择AI导师?结构不确定性下的稳健决策认证
多准则一致时RankCert才认证八种辅导策略,否则弃权;仅3.75%稳定场景通过,安全仅限基准内决策。
会出声思考的口语语言模型
提出异步出声思考框架,主推理流搭配轻量出声流,动态协调减少静默并保持准确率。
面向隐私感知多智能体LLM工作流的选择不变通信编译器
提出选择不变通信编译器,消除多智能体LLM工作流授权后选择通道泄漏并保持协议效用。
CacheDyG:解耦时序传播以实现高效动态图学习
解耦时序传播与参数更新,用缓存存储节点-时间表示,仅训练轻量精化器,大幅减少参数与耗时,性能优于基线。
FusionMMT:面向核聚变的统一多模态多任务学习框架
构建EAST-VTD640数据集,提出首个统一多模态多任务框架FusionMMT,用于核聚变诊断。
神经细胞自动机的应用:现状、挑战与机遇
综述神经细胞自动机的基础、架构改进及其在医学影像分析、分割、分类、配准、深度估计与图像合成中的应用,并分析其优势、研究空白与未来机遇。
FairMon:一种监控与可视化算法公平性的工具
FairMon面向高风险决策系统的运行时公平性监控,扩展RTLola条件概率算子,并实时可视化中间值。
如何判断你是否已在草堆中找到多根针:多标签文本分类中的校准度量
多标签校准度量欠缺,现有分箱偏差大;提出正负标签等权分箱,获可靠校准误差,并为大模型多标签校准奠定评估基础。
基于治疗前弥散及对比增强磁共振成像与临床变量的新辅助化疗反应预测
治疗前ADC、DCE-MRI联合临床变量深度学习预测乳腺癌新辅助化疗反应,融合HR/HER2后AUC达0.86。
0.5%>100%:面向指代图像分割的双向互惠学习
提出BRL适配器框架,实现冻结基础模型中双向跨模态交互,以不到0.5%参数更新达指代图像分割最优性能。
面向多模态目标重识别的激励噪声与结构先验注入
提出正激励噪声与结构化提示调制框架,破解文本噪声与跨模态结构差异难题。
最近精确匹配注意力(LEMA)
提出LEMA:二值化查询键,查询仅关注最近精确匹配键;可与word-RAM互相模拟;训练用直通估计与退火软注意力;长程召回优于GDN。
转录、翻译与优化:面向语音翻译的联合奖励学习
针对语音翻译中转录式思维链的训练—推理失配,提出GRPO联合奖励微调,实验提升BLEU并降低WER。
一个用于评估自然语言生成中保真度与覆盖度的符号学感知框架
提出符号学对齐评估框架,输出保真度与覆盖度;覆盖常低于保真,低采样温度下LLM与人工数据最对齐。
先定协议,再谈进步:AIS 轨迹预测的泄漏感知评估
泄漏感知评估显示,AIS轨迹预测增益多源于评估协议而非架构,区域不相交划分可致误差剧增。
上下文引导:通过数值基础模型学习任务间协同以实现少样本多任务优化
提出ICG-MTO框架,用冻结数值基础模型经上下文学习推断任务耦合引导,缓解少样本多任务优化负迁移并验证有效性。
校准应成为大语言模型评估的一级标准
现有基准多已具备置信度与正确性两项输入,校准可即刻报告;呼吁各子领域将校准与主指标并列,视其为模型必备属性。
ME-VLM:面向具身认知与智能体协同的统一视觉语言模型
提出统一视觉语言模型ME-VLM,融合具身认知与多模态智能体能力,兼顾多任务表现与端侧部署。
整合多模态超声与临床数据对肝细胞癌微血管侵犯的术前预测:一项多中心研究
多中心研究显示,整合多模态超声与临床数据可术前预测肝细胞癌微血管侵犯,外部验证AUC约0.90。
接纳而非谄媚:区分语言模型中的积极互动与顺从
社交谄媚评估与对话接纳性高度重合,或误罚可取行为;实验显示用户偏好更接纳的回应,并给出兼顾接纳与独立判断之法。