MeshHeal:去中心化LLM智能体网络中灰度故障的双时间尺度自愈
MeshHeal以快慢双时间尺度同伴评审自愈,隔离退化智能体并支持恢复重入,效率与准确率双优。
幻觉栖身何处:VQ 分词视觉语言模型中的跨架构回路
定位VQ分词视觉语言模型共有的早期层注意力路由回路,仅消融L0可使开放生成物体幻觉相对降31%。
评估小波扩散降水降尺度模型的跨区域泛化能力
评估小波扩散降水降尺度模型的跨区域泛化:单区域训练仍具竞争力,性能与降水空间自相关高度相关。
WildHSR:基于3D基础模型的度量前馈式4D人物-场景重建
3D基础模型前馈重建带度量尺度与人物身份的4D人物-场景,EMDB-2/RICH领先,10.1 fps。
动作信用何时需要更新?
动作价值变化未必改变决策:提出成对分支敏感度与DSC-Gate,择机复用或迁移历史信用,使新增工具调用减少39.4%。
使用分布式声学传感与深度学习以精细时空分辨率监测城市交通动态
利用分布式声学传感与深度学习,将地下光纤振动转化为车辆轨迹与交通状态,实现米级秒级城市交通监测。
词性作为SAE潜空间中的涌现类别
SAE激活可高度还原词性,但不与单个潜变量一一对应,而由稀疏潜变量的分布式组合支撑,开放与封闭类差异显著。
强化学习中的策略复杂度、反应时间与有限理性
提出 MI-SARSA,以互信息正则权衡收益与策略复杂度,预测反应时间,体现有限理性下的序列学习。
ArGuard 共享任务:阿拉伯语模因与大语言模型提示中的有害内容检测
ArGuard共享任务评测阿拉伯语模因与LLM提示的有害内容,含两赛道;35队参赛,A2细粒度模因分类最难,最佳宏F1为0.823、0.419、0.984、0.790。
利用卫星影像中的答案不变冗余实现边缘端高效VLM推理
Rift利用答案不变冗余剪枝与弹性预填充,边缘端能耗降78%、延迟降69%,准确率升至73%。
从政策文件到结构化调查响应:评估大语言模型在政策监测中的应用
用大语言模型从政策文本生成结构化调查响应,结构化指标与人工一致率达84%–95%,显示人机协同潜力。
BanglaTurn:面向孟加拉语语音的话轮结束检测基准与基于Whisper的模型
发布孟加拉语话轮结束检测语料BanglaTurn(3.5万样本),基于Whisper的模型准确率达84.33%,远超基线69.28%,CPU端到端延迟165–191毫秒。
流递归模型(SRM)
提出流递归模型SRM,组织多个交互潜在流递归精炼,便于分析流动态与因果贡献,性能媲美GPT-2。
CRISS:一种辅助癌症登记员的检索增强型AI聊天机器人
CRISS基于检索增强生成,为癌症登记员提供带引文的指南问答,RAG显著提升证据支撑与回答质量。
FluidRain:不可压缩雨流作为环中环视频去雨的注意力偏置
提出FluidRain,以无散度雨流为注意力偏置,跨尺度邻帧循环聚合,仅0.80M参数,并设新基准。
从自蒸馏到自实践:多轮智能体的特权信息
指出在线自蒸馏令多轮智能体盲目自信;提出PSP,把特权信息从损失移至采样提示,在两大基准上超越GRPO。
多链鲁棒平均奖励马尔可夫决策过程的向量贝尔曼理论
提出多链鲁棒平均奖励MDP的向量贝尔曼理论,建立增益-偏差耦合,刻画可解性并设计收敛算法。
AlphaDiverse:面向 Alpha 因子挖掘多样化探索的本地量化研究智能体后训练
针对外部API依赖和路径坍塌,提出AlphaDiverse,融合多路径采集、本地智能体后训练与GRPO,兼顾预测与多样探索。
EIB-Net:面向可泛化AI生成图像检测的熵引导信息瓶颈
EIB-Net以熵引导信息瓶颈选取低熵图块,学习紧凑泛化特征,检测AI生成图像;仅2%数据达85.7%准确率,跨生成器泛化强。
看见不等于测量:面向视觉语言模型的工具增强度量空间推理
为小型VLM加装几何工具,把度量计算移出模型权重:绝对距离MRA由0.46升至0.74,相对距离、方向大幅提升,编排开销仅0.03。
大语言模型中,似然排序的扩展表现不同于提示
95个模型10个数据集,陈述式似然排序准确率随规模稳定,提示回答随规模与指令微调显著提升,二者不可互换
面向WeBe Band的机器学习模型快速训练与部署流水线
面向WeBe Band的边缘机器学习自动化流水线,支持AutoML、硬件感知量化、固件生成和OTA部署,便于快速迭代与在设备评估。
LastOPD:驯服潜在在线策略蒸馏中的性能崩塌
提出LastOPD,仅在末层施加潜在信号并交叉淡化至词元级蒸馏,防止训练崩塌,显著提升MATH-500并加速收敛。
通过生成顺序干预评估解释驱动的视觉-语言推理
系统评估解释与预测的因果关联,发现解释顺序、模型规模与任务结构共同影响准确率与推理忠实度。
少即是多:仅编码器的音视频分割
提出仅编码器的EASE音视频分割方法,速度达365FPS,比最优模型快3倍,取得SotA性能。
硬预算重复评估中诚实不确定性的尖锐极限
硬预算重复评估中,刻画区间宽度随任务覆盖与复制的取舍,新设计大幅降低估计误差与区间宽度。
ASIRF:面向上下文相关敏感信息脱敏的智能体框架
ASIRF推理时按领域检索定义,无需重训练,80组测试中68组召回超越OpenAI隐私过滤器。
基于ℓp正则化的大语言模型低秩适配自动秩分配
提出ℓp-LoRA:以ℓp(0<p<1)正则约束各秩一分量能量,隐式阈值自动分配秩,性能与基线相当。
大型语言模型用于编程:究竟在修复,还是在重新实现错误代码?
研究对比大模型修错与人工补丁,发现其改动更多、常重写代码,且从头解题比修补更易成功。
扩散蒸馏分布匹配中的谱幅度净化
提出即插即用SAP-DMD,调制扩散蒸馏方向场幅度谱以抑制低频主导,促进细节恢复并提升少步采样质量。
A Wrong Turn Does Not Ruin the Journey: Deviation-Guided Skill Self-Evolution for LLM Agents
物理与数据驱动的 Transformer-Mamba 流场框架
提出物理约束的 Transformer-Mamba 流场框架 TM4FF,融合小波去噪、注意力与傅里叶物理损失,提升 CFD 精度与泛化。
仅差两个表情符号:多语言情感生成基准究竟在测量什么
审计多语言情感生成基准:系统差异不显著,排序实由标注者与输出长度驱动,故提出表情-情感可解码性探针。
FoCal:面向航拍可见光-红外目标检测的频率导向跨模态交互与光谱校准
提出FoCal,通过频率感知双域校准与差异引导光谱调制实现跨模态交互,三数据集上精度与效率领先。
IndicBankBench:评估印度零售银行场景中语言模型助手的安全性与可靠性
推出799例印度零售银行基准,四阶段评测安全与工具使用,11款模型严格通过率仅43.7%–58.2%。
UpDown-SC:面向室内LiDAR地点识别的重力规范化双包络Scan Context
提出免训练极坐标描述子UpDown-SC,重力规范化后构建上下双包络,提升室内及安装高度变化下LiDAR地点识别可靠性。
先定作用域,再谈持久化:防止智能体记忆中的跨任务族干扰
持久记忆智能体应匹配检索与认证范围,按任务族限定检索可防跨族干扰,提升效用且零有害部署。
Rufus-Air:一个开放的LLM后训练配方
Rufus-Air 是公开可复现的八阶段后训练配方,基于 GLM-4.5-Air-Base,从 SFT 到 RLHF,性能超越官方版本。
Agentic-GER:利用全局上下文恢复长语音中的术语
提出基于LLM的智能体Agentic-GER,利用全转录全局上下文识别可疑术语、选择性重转录验证并迭代修正,中英文术语转写均显著改善,中文B-CER相对降低达36.8%。
CounterRoute:基于分层反事实信用分配的自路由推理
CounterRoute无需SFT预热,靠分层反事实信用分配与课程学习联合优化自路由和回答,九基准上兼顾准确率与效率。
Med-AR:面向长尾胸部X射线分类与不确定性感知评估的自回归视觉-语言预训练
提出Med-AR-8B/2B放射学自回归视觉语言预训练模型,长尾胸片分类优于对比方法,尾部识别与选择性预测更佳。
在可流式全双工模型中控制反馈语
轻量反馈头从全双工模型隐状态预测反馈起始,阈值触发强制解码;跨规模有效,时机更准,人类评分媲美真实。
熵三角方法(ETM):一种预防心律失常的新型框架——附逾万例患者回顾
提出熵三角方法框架,含特征工程、熵三角过采样与预测三步,基于10,646例12导联心电数据,非窦性心律预测准确率超85%。
IterSynth:以角色解耦的迭代合成重新审视深度搜索智能体
提出角色解耦的摘要式搜索范式,规划者与综合者交替,结合RDPO,8B模型平均分50.7。
ComplexSync:复杂场景下的高保真实时唇形同步
提出基于扩散的统一框架ComplexSync,通过双流联合训练、蒸馏加速与关系对齐损失,在复杂场景下实现超70FPS的实时高保真唇形同步。
基于埃尔米特多项式的谱图神经网络:综合研究
提出基于埃尔米特多项式的谱图神经网络HermNet,无需特征分解;分析其校准与正则化的作用与局限。
基于电子先验的响应态学习用于可迁移振动光谱表征
响应态学习融合等变Transformer、卡尔曼桥与电子先验,实现可迁移高保真振动光谱预测。
面向后续岩土工程分析的多时相采场点云自动地理配准技术
提出3D-TARGeT,用低成本标签自动地理配准采场点云,多时相扫描达厘米级,优于常用方法。
面向生成式搜索的论断门控来源风险审计
提出论断门控审计:遗漏须在证据、采纳、重要性与披露齐备时判定,否则保留未决;合成套件验证契约一致性。
图像保真度并非场保真度:神经层析成像中的联合热力学重建与误差定位
神经层析中低图像误差不等于正确三维场;联合重建日冕热力学场,跨种子不稳可无真值定位局部误差。