基于可验证过程奖励的可监控图表推理智能体
提出Chart-RVR,用可验证过程奖励训练可监控图表推理智能体,分解为结构、证据、推导,显著提升可验证性。
基于文字系统感知混合专家的一体化多语言场景文本识别
构建千万级多文字数据集,文字系统感知MoE统一多语言场景文本识别,准确率82.06%,轻量超VLM。
视觉Transformer与卷积神经网络在物种丰富、数据匮乏植物区系中的细粒度兰科属级识别:新几内亚兰科的受控基准测试
新几内亚兰科数据稀缺下,DINOv2属级识别最佳,嵌入检索与开放集检测有效,并已发布网页应用。
从局部块到全局:面向全切片图像全局一致兆像素伪影修复的随机图块扩散
提出RestorePath,用潜在扩散与大核注意力实现兆像素全切片伪影全局一致修复,提升下游任务。
面向恶劣条件下鲁棒计算机视觉的配对合成建筑工地图像数据集
发布ConSynth-X配对合成工地图像数据集,含34,199张图和11类恶劣条件,支持鲁棒视觉与视觉语言评测。
基于图的反馈驱动猜词推理:面向Jotto问题的可扩展框架
图模型Jotto猜词,共同字母数作边权,约束传播缩小词空间,支持变长与重复字母,迭代数随词长对数下降。
影响并非失效:要问断言是否成立,而非问代码差异
改为追问具体断言是否仍成立,模型精确率由0.29升至0.97;问对问题比模型能力更关键。
Qwen3.8-Omni:迈向原生全模态智能体
原生多模态智能体模型,提升多模态理解推理与长程任务,支持百万上下文,并开源插件与实时交互框架。
FinFIRST:面向金融信息检索、信息溯源与可追溯性的搜索智能体基准测试
首个同时评估答案与支撑证据的金融搜索基准,含123个专家任务,使研究过程可测量、可验证、可诊断。
ShowTellArena:从演示中评估业务工作流理解
推出ShowTellArena基准与数据集,含50项业务流程任务和502道题,评估智能体对演示讲解的理解。
中文标题:推理大语言模型强化学习中的Rollout效率:分类体系与未来方向
系统综述推理大模型强化学习的rollout效率:按机制与瓶颈分类方法,分析技术组合冲突与评估缺口。
FineWeb-CLaR:面向基准对齐语料审计的文化、语言与区域标注
从FineWeb构建大规模文化-语言-区域标注数据集,并将277个文化基准同轴对齐,支持语料覆盖审计。
Spectra:面向自动化KYC文档处理的规则驱动LLM流水线
规则引擎结合LLM自动处理KYC文档,分类准确率100%、抽取89.4%,人工复核降96%。
TelecomGPT-R1:面向异构电信任务推理的统一后训练
开源电信推理模型 TelecomGPT-R1 经轴感知数据生成与 DAPO 强化学习,七项基准均分 89.64%,超越 GPT-5 等。
多期傅里叶图神经网络结合样本关系学习用于增强剩余使用寿命预测
提出MTFGN-SRL,傅里叶图神经网络频域建模,多期窗口与样本关系学习提升剩余寿命预测精度和鲁棒性。
恢复智能体主权:通过对比认知解码缓解共识悖论
提出对比认知解码(CED),零样本抑制LLM从众偏见,缓解共识悖论,准确率最高提升30.75%。
RAG-NAROK:基于来源特定反驳的检索感知型RAG知识语料投毒
提出RAG-NAROK,利用RAG检索透明性提取来源身份,动态生成针对来源的反驳文档,借时效与权威偏见操纵生成。
优先经验回放中的组内自选择偏差校正
优先回放会扭曲同状态-动作组内的结果分布,提出SAMPLE等组内校正法,恢复经验频率并提升学习效率。
基于Transformer机器学习的OpenXR实时手势识别
利用OpenXR手部追踪数据,基于Transformer实现实时手势识别,提升跨手型与朝向的分类准确率。
训练了却没学到:面向作为前线部署工程师的 LLM 智能体的后训练交付基准
提出后训练交付基准,考察LLM智能体作为前线部署工程师的可信交付,揭示“训而不学”静默失败,并对比四个前沿智能体与人类FDE。
迈向参与式语音数据集策管:酷儿案例研究与概念框架
酷儿案例表明,需参与式语音数据集策管,并提出社区界定、项目构思、参与方式与个人自主框架。
SMTB:带紧界的快速结构映射
提出SMTB算法,较SME快5–15倍,大嵌套域映射能力提升约50%,适用于任意关系图。
套娃归因:学习将语言模型输出归因于表征与权重
提出套娃归因MAttr,用可微top-k掩码学组件嵌套排序,登顶机制可解释性基准,定位致拒答的1%权重。
语音数据集中的酷儿包容性:实践张力的审计与分类
审查语音数据集酷儿包容性,代表性仅0–1.4%;对比社区共建数据,揭示AI语音采集实践张力并分类。
基于无定向算子的拓扑信号处理
提出无定向拓扑信号处理,以无向关联矩阵替代有向边界算子,引入交互阶分解及阶感知正则化,重建效果更优。
神经 CAE 代理模型的预测不确定性
比较高斯过程、蒙特卡洛丢弃与深度集成在神经CAE代理中的不确定性;优劣随数据集和指标而变,宜按下游决策选择。
美国公司判例法中的法律论证挖掘
首个42份美国联邦税务重组判例的专家标注树状论证语料,五类标签与支持树;分类检索可行,跨案泛化弱。
时空克罗内克协方差神经网络
提出KVNN,用克罗内克积解耦时空协方差,具备严格谱分析且抗噪,在五个真实数据集上预测优、参数少。
CoaG:网格上的圆柱体——面向视频生成的粗略三维布局控制
画地面网格、每人一圆柱,即可控制视频中人物站位与相机运镜;自动合成数据训练LoRA实现。
将长上下文压缩为答案对齐的记忆嵌入以用于LLM推理
CMC把长上下文压成答案导向的记忆嵌入,配问题引导选择与局部窗口,提升QA并省时省显存。
因果视角下的概念漂移
从因果视角提出基于结构因果模型的概念漂移分类与数据流生成方法,揭示不同漂移来源影响并支持因果感知评估。
弱监督量子误差缓解
无需理想标签,以启发式信号和概率标签模型反演读出误差,在IBM五比特电路上显著优于最强解析基线。
单独通过、合并失败:并行 LLM 智能体开发中的语义协调基准测试
并行智能体补丁单独通过却合并失败;构造任务干扰率97%,并发变更提示可恢复82%,已审查PR干扰少
LegendBench:面向图例理解与反事实干预的诊断基准
LegendBench以能力分类和反事实变体诊断图例理解,揭示绑定与一致性瓶颈,并指导定向微调。
基于物品兼容图的一维装箱深度强化学习
提出物品兼容图上的图强化学习框架求解一维装箱,可零样本泛化,BPPLIB上平均最优差距降至2.31%。
压力下的行为:当用户施压时,六十个语言模型会怎么做
六十个语言模型受压时是否放弃正确立场:能否坚持与代际相关,方式与厂商相关,机器标注比人工一致。
面向安全人车交互的轻量化行人头部朝向识别网络
提出轻量级LRHO-CNN,实现低分辨率行人头部八类朝向识别,精度优于ResNet、VGG基线,并经JAAD、PIE数据集验证。
MT-ProtBERT:数据稀缺下内在无序蛋白分类的多任务学习ProtBERT
MT-ProtBERT以动态掩码、多尺度卷积和多任务学习,数据稀缺下提升无序蛋白分类,优于PARROT。
Action-Slot:面向多智能体原子活动理解的结构化以动作为中心表示学习
提出Action-Slot以类别对齐槽、时空并行更新和负槽正则,实现多智能体原子活动识别与弱监督定位
SAFe:面向异常感知分割的分段引导式特征密度聚合
用DINOv3特征训练类条件归一化流,融合多尺度特征,借SAM3后处理生成空间一致分割,实现实例级异常检测。
扩展 FunctionGemma 以实现实用的端侧移动函数调用。
构建约9500条安卓控制数据并微调,端侧函数调用准确率升至76.5%,推动低延迟隐私保护助手。
基于语义自适应运动-光照响应的可重光照3D头像重建
提出SAMIRA,按面部语义区域自适应建模运动与光照响应,提升3D高斯头像表情重建与重光照真实感。
STAR:面向端到端认知雷达的场景与任务感知4D雷达预处理
STAR融合场景与任务目标生成任务相关雷达点,K-Radar达74.3AP,超SOTA5.6AP。
视觉目标至关重要:面向脑到图像检索的跨视觉层级学习
提出NeuroGlyph,跨冻结视觉骨干多层学习检索目标,以因子子空间和图像条件深度分配融合,提升脑到图像检索。
在患者拍摄的皮肤图像上对现成多模态AI模型与皮肤科医生进行基准评测
多模态AI判读皮肤图像,与皮肤科医生相当或略逊;置信度校准差,元数据影响随模型而异,成本不预示性能
一个出人意料的机器人策略:GPT-6 Astra 在 RoboDojo 及更广范围上的早期评估
GPT-6 Astra无需微调即可作为机器人操作策略,在RoboDojo上平均成功率22.48%,超越所有公开策略;但精度与动态控制仍是短板。
轻量级排序头:加速生产级推荐系统中的多任务实验
提出轻量级排序头框架,动态注入新任务,免重训主干、隔离冲突,将多任务实验周期从数周缩至数天。
从话语到网络:建模俚语在Reddit各子版块间的采纳与扩散
用LLM标注结合网络与语言分析,发现桥接资本促进俚语采纳、黏结资本抑制,语境越广采纳越慢。
ClusterFewshot:面向大语言模型工作流的少样本优化改进
结合语义聚类与效用评分构建代表性少样本示例,显著降低LLM工作流优化成本并提升准确率。
证候、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐
针对中医处方生成中推理、随访调整与安全禁忌三大缺口,提出四阶段框架显著提升处方质量。