奖励新颖推导:求解器引导的逻辑推理过程奖励
SPRING以SMT求解器验证中间推理步骤,奖励新颖有效推导、惩罚矛盾冗余,在三大逻辑基准上显著超越基线。
基于草图切向一致性的神经算子在线导数信息训练
提出sTCL,用随机草图扰动在线约束神经算子灵敏度,无需离线导数标签,多类PDE精度媲美DIFNO。
使用大语言模型检测大语言模型生成的文本:一项跨代分析
评估15个大模型跨三代:检测效果取决于检测器而非生成来源,自我检测无优势,各代存在漏检、误报偏差。
基于自洽性的扩散视频推理学习
提出自洽测试时扩展与拒绝微调,蒸馏多轮共识到扩散视频模型,视觉搜索准确率由48.4%升至99.0%。
公平事实核查:以 RoSh 弥合大语言模型事实判断的跨语言鸿沟
提出免训练RoSh,按语言平移旋转残差流,平均弥合75%跨语言事实判断差距,小模型提升最大。
RGDT-Bench:面向规则约束决策及其论证的大语言模型推理基准
RGDT-Bench评测规则约束决策及论证;正确回答理由不完整约四成,现有评估难检测,奖励模型提升。
CARDAMOM:面向自动语音识别的微方言阿拉伯语语音数据集
发布约40小时、覆盖6国21种微方言的阿拉伯语语音数据集,含转写与标注,并评测ASR系统。
逻辑门网络与查找表网络:面向患者间心电图心律失常分类的轻量级硬件分类器
可微逻辑门与查找表网络实现患者间心电心律失常分类,准确率达94.41%,算力与能耗极低,适合轻量硬件。
无代码的论文:*CL会议论文中链接的GitHub仓库可用性
CL期刊及ACL等会议论文的GitHub仓库可用性研究:新论文失效率与旧论文相当,空仓库增多。
异构移动无线网络中的空中联邦学习
提出FedOAG,用梯度归一化与隐式gossip抵消异构衰落,实现无偏空中联邦学习,收敛率O(1/√T)。
面向免对齐神经权重生成的排列等变流匹配
以排列等变图元网络参数化流匹配速度场,无需对齐即可从独立训练网络学习并生成神经权重。
动态文本属性图上的边分类迁移学习
提出动态文本属性图边分类的跨域迁移协议,揭示现有方法泛化不足,并设计时空语义对齐STSA提升性能。
HamiFormer:基于仿射辛映射的双专家扩散场
HamiFormer双专家扩散场,融合全窗口去噪、哈密顿传播与并行仿射辛扫描,降低自回归误差,192步MSE较基线降26.3%/21.4%。
RoPE已死,RoPE万岁:迈向可扩展的数据感知位置编码
提出DaRoPE:慢频段用数据学习有界坐标替代绝对位置,缓解近因偏差,非文本领先,语言建模与外推持平。
基于偏好优化的可泛化终身模型编辑
GLIME结合知识编辑与偏好优化,借回放与梯度约束,提升终身编辑泛化并保持模型通用能力。
MLToolBench:面向机器学习开发的工具增强智能体学习
提出诊断工具集与SPICE轮级奖励训练,使智能体学会用工具,域内成功率升至69.2%。
ProGuT:面向森林场景的标签高效全景分割
ProGuT借助CLIP特征聚类与结构张量几何先验生成全景伪标签,无需逐图掩码,森林分割性能显著超越无监督基线。
无需共享门控或跨智能体梯度的自监督协作视觉专家群体中的涌现专业化
无共享门控与跨智能体梯度,自监督视觉专家群体仍能涌现有用分工,语义路由优于单一通才。
RoXDrive:通过动作忠实推演实现端到端自动驾驶的闭环强化学习
RoXDrive:识别动作忠实世界模型推演,进行闭环强化学习后训练,显著减少自动驾驶安全违规。
BiFE:基于LLM双保真度演化的搜索高效纯CPU分支策略发现
BiFE以低保真预筛、高保真评估精英,高效搜索纯CPU分支策略,性能超越SCIP及部分GPU策略。
AI科学家会改变想法吗?合成宇宙中的先验—证据冲突
提出合成宇宙基准,配对经典与扭曲孪生世界;发现预测充分性与机制恢复相分离,须分别检验。
无法恢复从未被测量之物:量化超低场MRI超分辨率的信息上限
真实64mT MRI个体信息仅约3–4mm;合成数据高估可恢复性,超分细节难辨恢复与虚构。
智能体能否为智能体设计程序库?
推出LibraryDesignBench基准,评测智能体为智能体设计库的能力,发现下游复用不足,改进指引可提升复用与简洁性。
JudgeProfile:理解并引导 LLM 裁判的主观性
JudgeProfile将LLM评判拆为感知与优先级,重加权调控主观性,一致率升至71.97%。
社交性锚点:迈向群体边界约束的轨迹预测
提出 Socialality 框架,以可解释锚点和扩展窗口实现个体化、上下文自适应分组与群体轨迹预测。
同策略视觉证据蒸馏
提出ReVuE同策略视觉证据蒸馏,对比学生轨迹诊断获取/读取/对齐失败,反思重加权token蒸馏损失,提升视觉推理。
VGGT 系列模型需要用到所有层吗?
VGGT 系列前馈几何模型的可删层集中于前段与后段,剪枝并经线性校准后可减少44%参数而精度持平。
SIPO:统一强化学习与同策略自蒸馏
SIPO以对比自教师提供密集token级反馈,统一强化学习与同策略自蒸馏,推理和代码任务超越RLVR与OPSD。
S4VY:前馈4D视觉几何中的任意分割
提出S4VY,基于前馈4D视觉几何实现类无关4D实例分割,支持提示与语言引导,性能领先。
世界模型的自适应潜在容量
提出ALeWM,基于JEPA将预测信息集中于宽潜在表示的紧凑前缀,并设计MixSIGReg防坍缩,成功率更高、规划容量更低。
GlassFormer:基于雷达-深度融合的实时玻璃分割学习
融合雷达与RGB-D,提出GlassFormer,以跨模态注意力实现实时透明表面分割,低光下稳健。
超越词元对齐:跨分词器同策略蒸馏中的事件补全
提出事件集补全蒸馏,用补全集监督补充跨分词器概率对齐,免额外采样,在数学、代码与科学推理蒸馏中稳定提升。
梯度噪声下的 Muon 与最优解附近正交化的局限
最优解附近噪声主导时,Muon 正交化仅匹配一阶响应,残留协方差抬高损失下限,宜改用匹配动量 SGD。
调整语义而非结构:面向科学PDF抽取的少样本模式校准
提出CPSE框架,用少量标注校准字段语义与提示并保留结构契约,在聚合物文档上较基线提升9.93分。
EASE:面向自进化智能体的行为自适应技能策管
EASE让智能体按执行器行为在线自适应策管技能,跨执行器共享强化学习,技能更精、检索更准、开销更低。
区分还是同化:不可逆资源耗尽下的最后机会策略识别与风险预算恢复
不可逆资源耗尽下,权衡区分故障与同质化状态,提出最后机会策略识别和风险预算恢复,满足失败预算。
更少监督,更好泛化:扩散编辑图像中的弱监督伪造区域定位
提出弱监督框架ReGFLoW定位扩散编辑伪造区域,仅需图像级标签,以扩散重建误差引导多示例学习,跨域泛化优于全监督。
驻留吸引子:在神经代理模型离开吸引子处监督三维湍流
提出离吸引子监督,用DNS重标注偏离态,三维湍流预测失败中位步数由21升至721。
Draft-KV:学习语言模型间有用的潜在通信
Draft-KV 以起草答案的 KV 状态做潜在通信,冻结模型仅训 1.05M 参数,显著提升接收器准确率。
S2T-Unet:一种面向跨模态MRI转换的结构到风格框架
提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。
TQTS-Bench:面向时序数据库的多语法文本到查询基准
含6125个问答对、97个时序数据库与23种语法;最佳模型准确率仅48.98%,人类达87.34%。
更少刷新,更优选择:复用陈旧梯度特征实现高效的基于影响数据选择
提出CDIS,复用陈旧梯度特征,仅重算高分候选并校准,选择成本仅约1/3.4,性能近全量重算。
LongPuzzleBench:评估 GUI 智能体在长程视觉谜题上的表现
LongPuzzleBench评估GUI智能体长程视觉谜题:114关六款游戏,强智能体在更难长局骤败,因其只看当前进展、不顾未来选择。
InfiMed2:基于上下文证据与稳定性感知监督的通用医学多模态基础模型
InfiMed2为4B/27B通用医学多模态基础模型,阶段感知数据设计与稳定性监督,医疗基准超越开源同类。
函数级漏洞评分更多衡量标记率而非模型:协议对配对基准的影响
函数级漏洞F1主要反映标记率而非模型:固定输出下协议影响小,模型与基准差异更大。
从弱任务规范到科学抽取智能体:优化任务构建
针对科学抽取智能体,提出从简短目标与未标注文献的弱规范出发,自动构建并持续优化任务模式、抽取指令与评估标准。
面向指令遵循泰英机器翻译的参考锚定数据整理
提出参考锚定数据整理法,构建197万条数据训练泰英翻译模型ChindaMT,各规模均超同尺寸基线。
OpenWhistle:大规模纵向宽吻海豚发声数据集与基准
发布首个公开宽吻海豚哨声数据集,含五年约18万条录音、专家标注及评测基准。
及格还是不及格?在两项希腊考试基准上评估大语言模型
发布两项希腊考试基准,评测多款大模型;本地化小模型媲美大模型,少样本提示反致结构化任务性能下降。
面向冻结EEG表征的测量门控来源衰减
提出MGPA:在测量门控内校正来源分数,无需重训;跨设备与任务可降低来源可预测性并保持/提升性能。