CogenPVG:面向说服性视频生成的认知增强反思式多智能体框架
提出CogenPVG框架,将说服性视频生成分为四阶段,结合ELM理论用生成-评论双智能体迭代优化,说服效果最佳。
Video-HopChain:面向视频推理模型的多跳问题与置信度门控探索
构建多跳视频问答数据集,两阶段GRPO训练提升八基准,提出置信度门控探索使均分达59.3。
MorphoSHAP:重新思考深度视觉模型解释中的归因单元
MorphoSHAP以形态学形状为Shapley归因单元,解释证据位置、结构类型与贡献强度,性能与用户偏好均优。
COMED:多LLM推理中路由与协作之间缺失的中间地带
揭示跨模型协作的非单调性,COMED以锚点自洽、路由边距与轻量探针选择性升级协作,在16项基准上最多提升10.7个百分点且更省算力。
当学习式上下文规划未能胜过强检索:面向长上下文问答的规划、路由与重排序对照研究
受控实验表明,学习式上下文规划经强检索、路由与重排序控制后仍不及混合检索,只是弱相关信号。
专家在LLM分歧处登场:利用跨模型分歧定位专家投入,改进大规模标注的LLM编码手册修订
以LLM跨模型分歧定位专家投入;理由标注法准确率64.9%,优于专家修订手册,将数月修订缩短至数天。
事实核查得分提升时究竟改变了什么?训练验证器与大语言模型中的证据与答案归因
联合分数提升主要来自证据改善而非答案准确率;扩大上下文可放大证据增益,聚合指标会掩盖声明级差异。
句子级解释准则分类:来自德国联邦宪法法院的基准
基于德国联邦宪法法院判决,构建句子级解释准则分类基准;四模型七项子任务平均F1为70.4–79.2。
面向机器学习聚合物性质预测的开放基准
发布PolyBench26开放数据集,涵盖近25万条、八种性质的聚合物数据,支持四类评测任务;结果显示图模型预测误差最低,且在不同训练规模与重复单元复杂度下均保持稳健。
从温室气候到单叶:一种器官分辨的生菜生长模型
构建器官分辨生菜生长模型,逐叶模拟光合与三维结构互作,干重预测误差9.5%,支撑温室数字孪生决策。
论多目标强化学习中事后重标记引发的偏好覆盖坍缩
多目标强化学习按实际达成偏好做事后重标记会致偏好覆盖坍缩,损害多数设置;her_mix 单参数凸组合可将多数恢复至基线。
LEGO:协同专家GraphRAG与专家思维链进行法律推理
LEGO融合法律专家GraphRAG与专家思维链,借规范关系检索和结构化推理提升大模型法律推理能力。
能识别却无法生成:面向文化特定亲属称谓的生成基准
多选高分但生成低分:五种开源LLM在印地、泰米尔、韩语亲属称谓生成中准确率骤降,需生成式评估。
面向成本高效空间转录组学的主动位点选择基准测试
空间转录组主动选点基准显示:小预算下主动策略未稳定优于随机采样,且排序依赖评价指标。
后处理公平性约束何时有益、何时有害:来自八项跨域评估的证据
FAPE跨八领域评估:后处理公平约束在高基线差异时多改善、近公平时反恶化;单次审计不可靠,需持续监控。
CORE-STACK+:面向深度堆叠泛化的元学习
CORE-STACK+缓解异构视觉堆叠的共线性与校准崩溃,多基准提升且降模型量与算力。
记忆抹除:人脸识别模型嵌入空间中的对抗性选择性身份遗忘
提出开放集对抗遗忘,用三种损失微调人脸识别嵌入空间,使选定身份不可链接且不影响其余人群。
MINER:面向冻结双编码器的稀有物体检索多裁剪推理增强
免训练MINER用区域嵌入与相似度重打分增强冻结双编码器,提升杂乱场景稀有物体检索并发布ROCS基准。
伊利诺伊社会态度聚合语料库(ISAAC):用于大规模分析社会群体话语的开放工具与可复现流程
推出ISAAC:5.27亿条Reddit帖子,覆盖六类社会群体,支持标注、验证与可复现分析。
基于自适应分层集成学习与不确定性估计的太阳磁图超分辨率
以图像复杂度分层训练专家网络集成,配轻量路由与不确定性估计,实现MDI到HMI磁图超分辨。
PEARL:面向实时、匿名与异构协同感知的轻量级提示式特征解释器框架
提出PEARL轻量提示式框架,以双多尺度解释器实现匿名、实时异构协同感知,免共享配置,提精度降通信。
EduBehaviors:面向教育对话可审计编码的基于断言模式
提出EduBehaviors框架,用大模型测量可观察行为并训练分类器,实现可解释、可扩展、可审计的教育对话标注,在TalkMoves上具竞争力,并开源工具。
CRISP:面向不平衡表格学习的可扩展重要性分层核心集
线性时间核心集法:按代理分数分层分配负类预算并逆倾向加权,生产数据减95%负类仍保99.7%精度。
面向手术的层次感知视频-语言模型评估与双曲基线
提出层次感知评测基准与双曲基线模型,揭示同准确率下错误严重度差异,双曲几何可提升预测的层次一致性。
TinyUDE:在微控制器上通过李-泰勒射流匹配实现无求解器通用微分方程
提出无求解器李-泰勒射流匹配,可在微控制器上实时低内存训练通用微分方程,精度媲美或超过求解器基线。
GeoRVQ:生理信号残差 token 预测中的解码器感知几何
GeoRVQ以解码器感知几何软目标改进生理信号残差量化掩码建模,提升解码保真度与R峰检测。
设计即多样:面向原型可解释性的架构约束
提出DAPL,以一对一注意力映射的架构约束强制原型多样性,结合前景感知训练与覆盖度、多样性量化指标。
面向高速公路交通监测的路侧基础设施雷达系统系统性评估
发布DRaT数据集,评估路侧雷达:检测精度受限,跟踪可靠,速度估计准,密度流量低估23%。
资源高效的分布式递推高斯过程
提出两种分布式递推高斯过程算法,分析收敛性并优化参数,实测显著降低通信量且精度相当。
LexLattice:通过文档层级上的神经细胞自动机实现多语言抽取式摘要
将法律文档层级映射为二维语义晶格,用神经细胞自动机整合证据,实现多语言抽取式摘要,24语种SOTA。
WTF?!基于Wasserstein倾斜流映射的无仿真强化学习
提出WTF框架,用Wasserstein倾斜流映射实现无仿真强化学习微调,少步推理即保持高奖励,训练算力最多省280倍。
面向遥感变化检测的时序有序区域Token Mamba与Logit空间扩散
提出BMD-CD,融合时序有序Mamba与Logit空间扩散,实现高精度、强边界、高效的遥感变化检测。
面向有限集多模态轨迹预测的目的地支撑恢复
提出DSR后选择算子,无需重训或扩大集合,修复目的地支撑并重分配冗余假设,显著降低预测误差。
CricRAG:面向个性化板球训练的检索增强视觉语言模型
以检索相似但更优的动作为参考,为板球选手提供契合自身水平的个性化反馈,专业评估一致率达94%。
Skytopia:基于动作条件潜在世界模型的单目无人机导航
Skytopia用动作条件潜在世界模型预测表征,单策略支持三类导航,成功率66%,实机零微调部署。
限电导致数据稀缺下的太阳能光伏发电预测:基于共形化分位数回归的迁移学习
迁移学习结合共形分位数回归,限电致数据稀缺下光伏预测RMSE降23.7%,经验覆盖率达94.3%。
BAS-OPD:面向细粒度多模态感知的预算感知选择性同策略自蒸馏
BAS-OPD按预算选择性分配教师监督,仅改训练分配、保持单次全图推理,以更低成本提升细粒度多模态感知。
迈向负责任的AI增强网络防御:模式识别、纵深防御与人机协作的理由
构建形式模型量化AI增强纵深防御与人机复核权衡,证明全量人工复核非最优,提出SOC内点最优容量比。
互惠协作:GLAM机构融合的经验如何助推跨学科AI研究
AI跨学科合作常沦为单向服务,本文借鉴GLAM融合经验,提出互惠协作模式与五项关键实践。
SE-MSB:基于 Mamba 薛定谔桥的端到端非配对语音增强
提出完全非配对语音增强框架,用Mamba薛定谔桥端到端处理波形,性能媲美或超越基线,推理快数个数量级。
从声明损失与可达状态编译充分治理上下文:具基数与成本目标的精确观测契约合成
合成充分观测契约,区分必要属性与联合充分集,按基数或成本择优;实验显示核心不充分、成本可平局,求解器远快于枚举。
REVE:通过复用编码器状态实现大型音频语言模型的高效幻觉校正
REVE复用目标模型已算的编码器状态验证音频事件提及,无需二次编码,消除92.9%无支撑提及,延迟仅CED-Base的1/18。
EMERGE:基于等变图扩散的分辨率无关点云生成
提出首个完全SE(3)等变图扩散点云生成骨干,支持任意分辨率零样本推理,质量SOTA且收敛更快。
NADI 2026:第二届多方言阿拉伯语语音处理共享任务
NADI 2026设五项八子任务,覆盖ASR、方言识别、TTS、翻译与理解;域外泛化仍是瓶颈。
线性表示假设需要一个群作用
线性表示假设实为按表示等价性区分的一族命题,可用群作用形式化表示对象、生成过程与断言性质。
训练好的GNN中的局部证据与几何读出修复
线性规划分离GNN误差来源,重加权与平移修复可提升准确率,平移贡献更大;局部证据难选,放宽约束更有效。
视觉语言模型看似的能力极限,实为读出极限
视觉语言模型评测中答案格式并非中性;看似能力不足常是读出限制,甚至会改变模型排名。
学习关节运动约束下的单目视频手术运动学
提出单目视频手术器械运动学重建网络,估计位置、姿态与钳口角,Open-H上降低路径误差并提升运动分割精度。
大型推理模型推理阶段的能力与效率扩展
评估推理模型发现:规模扩大带来能力收益递减,推理效率几乎无提升。
数证据,而非数句子:面向长文本价值测量的LLM判断退火证据融合
提出免训练TEF,按信息增益加权句子证据、抑制不确定句,在MIND基准上平均提升4.5个准确率点。