随机递归模型
提出随机递归模型RRM,从层池随机采样执行递归,参数更少,性能匹配或超越基线,推理时可调深度并提升表现。
ARCCS:自动化监管合规检查系统
首个开源端到端合规检查系统,分解条文并凭证据评估;GDPR一致率96.67%,采购违规检出98.8%。
OptimusMesh:通过稀疏潜在枢轴从点云生成紧凑自回归网格
OptimusMesh将点云压缩为16个稀疏潜在枢轴,两阶段自回归直接生成紧凑三角网格,面数减少25.7%–94.1%,几何保真度具竞争力。
基于训练动力学动作的一步生成建模
TDAction按共享参数实现代价选择传输目标,兼顾分布进展,ImageNet无蒸馏FID<1.1。
联邦智能体优化
提出联邦智能体优化,使分布式智能体在保留本地隐私数据下受控交换信息、协作提升,并平衡效用、隐私与通信成本。
SimplexUQ:面向单纯形值预测的共形不确定性评估框架与基准
首个单纯形值预测共形不确定性基准,用12项任务比较现有包装器的覆盖分配,揭示全局校准不均且无普适最优。
评估面向纵向临床笔记的大语言模型问答中的生物医学重排序
生物医学重排序提升临床笔记检索Hit@10(46.6%→60.6%),答案正确率仅微增至48.6%
什么能赢得一票?法国Compar:IA大语言模型竞技场中的格式、长度与词汇多样性
13.7万法语投票:格式、长度与词汇多样性影响胜负;调整排名变动大却未更准,宜并列原始与调整排名。
在线非单调DR子模最大化的几何相关界
研究在线非单调DR子模最大化,给出几何相关上下界,将系数提升至4/9,并刻画最优缺口。
AI 生成的科学文本是否遵循人类论证模式?——基于 CARS 模型的研究论文引言对比
人类写的研究引言在论证步骤的选择与顺序上更灵活,AI 生成文本更统一;给出 CARS 定义后 AI 反而更僵化。
冗余遇见协同:基于子模优化的MoE依赖感知专家选择
提出DS-MoE,以差子模优化实现MoE依赖感知专家选择,平衡冗余与协同,性能优于基线。
面向本体网络构建的LLM辅助类型化语义链接发现
结合嵌入聚类预筛与GPT-4o提示生成类型化语义链接,80万概念对缩至9.5万,精度80.19%。
正确答案,错误状态:多智能体协作中的隐藏信息失效
多智能体协作常以答案正确为成功,却忽视信息状态损坏;证据验证与状态重建远低于任务解决,所提方法可改善。
SHAMS:面向黎凡特阿拉伯语的音频锚定发音基准
SHAMS:覆盖五种黎凡特阿语变体的1300条语音基准,四层对齐,支持发音与语音识别评测。
AutoGUIWorld:将图像生成器作为GUI智能体的视觉世界模型
无需部署软件,用图像生成器与规划器合成GUI交互轨迹,微调后显著提升OSWorld与ScienceBoard任务表现。
ProtoFlow:用于多变量时间序列预测的原型引导流匹配
ProtoFlow以VQ码本为原型先验,用DiT修正流实现高效非自回归多变量时间序列预测,性能领先。
什么让事物变得更难?用自然语言解释问题难度
从大模型回答中估计题目难度,自动生成并验证自然语言假设,解释题目为何更难,预测力强且具因果性。
EgoFound3R:基于逐点交互属性的端到端世界空间第一视角手部重建
EgoFound3R 以端到端统一模型在世界空间重建第一视角手部几何,并同程预测逐点可见性、接触与距离,精度显著提升、吞吐约 6 倍。
学习提问:预算约束下面向SLM-LLM协作的信息获取
将SLM-LLM协作建模为预算受限的信息获取:SLM按需向黑盒LLM发问,三阶段RLVR学习何时调用、如何提问与整合,优化性能成本权衡。
ORBIT-FMIB:通过ESM-2追踪按阶数解析的上位性信息
ORBIT-FMIB用Walsh分解与神经依赖估计,探测ESM-2各阶上位性信息;复现显示高阶保留差异不稳健,结论未定。
审计规则如何塑造大语言模型中忠实的因素解释
报告依赖型审计会激励大语言模型隐瞒重要因素,加入报告无关的审计成分可促使其如实汇报。
MIKASA-Robo-VLA:面向长时程操作的VLA模型记忆能力基准测试
VLA长时程操作记忆基准:90任务多隐藏线索,28个信息间隙超16帧,2.25万条轨迹,基线成功率0.211。
无需等待的反馈:在大型数学课堂中试点生成式AI练习平台
设计生成式AI练习平台,在大型数学课中即时提供支架式反馈,将人工监督前移至答案预先核验。
DeFA:面向LLM智能体的依赖引导式故障归因
DeFA以事件依赖图与故障传播图定位智能体决定性错误,多项基准达最优,其诊断反馈还能提升下游任务精度。
面向动态推理的修订感知独立智能体图
提出RIAG多智能体策略,分离时间解析与推理,缓存并条件审计修复,动态路由准确率显著优于基线。
面向智能交通系统与物流的可信数据运维与机器学习运维
综述智能交通与物流领域的可信DataOps与MLOps,探讨其工具、案例、AI可信方法及未来挑战。
人格设定仍在,但究竟是谁在说话?持久化AI智能体中的潜在身份回退
失去系统人格锚定后,常驻智能体可潜在回退为底层身份;历史仍含人格却未必践行,需锚定与对话维持。
重尾噪声下的线性系统学习:基于单条轨迹的非渐近分析
重尾噪声下,基于单条轨迹给出指数稳定线性系统最小二乘估计的非渐近误差界,并推广至次高斯与次指数噪声。
右对齐原地(RiP)卷积:一种简单、通用且近最优的内存高效CNN推理策略
提出RiP卷积,纠正并泛化原地卷积,近最优省内存,峰值激活内存降12.5%–33.3%且输出不变。
第二个模型何时有帮助?LLM验证中的跨模型审查
跨模型审查与同模型F1无显著差异,发现错误部分不同;同模型加跨模型优于两次同模型,但未显著优于强跨模型两次。
SCOPE-AD:面向诊断智能体的基于能量模型的序贯成本感知序数信念规划
SCOPE-AD用能量模型规划成本感知序贯检查,在ADNI以50.46美元成本达77.70% Macro-F1,超基线9.34个百分点。
学习恒等映射:SGD 如何选择函数分解的案例研究
深度线性残差网络学恒等映射时,SGD偏好特定层分解而非零权重;熵损失可解释,重参数化改变结果
一种面向动态场景的紧凑显式4D表示
提出Sparc4D,将单目视频编码为稀疏4D状态,压缩动态特征,重建质量优且紧凑,可迁移。
DAYJOB:长周期专业工作基准测试
DAYJOB 基准涵盖医疗与金融共130项长周期专业任务,最强模型通过率约24%,中位配置不足3%。
GAW-PO:基于梯度对齐词元权重的偏好优化
GAW-PO按梯度对齐度重新加权被拒词元的负向惩罚,在11项基准上超越DPO,且对强偏好优化更稳健。
对 WebArena-Lite 上网络智能体评估的审计:对结果与轨迹的人工复核
人工复核165项任务,纠正自动评估漏判5–8个百分点,发现滚动循环等失败模式,最终分数不足以评估智能体。
问卷引导的家庭智能电表数据电器用电分解
提出问卷引导的无标签分解系统,将智能电表数据分为9类电器,在多数据集上误差最低,并给出节能建议。
基于动态归航优化的三维网格生成流匹配强化学习
提出动态归航优化DHO,将负轨迹优化转为正样本吸引引导归航,构建Flow3D-Pro提升3D网格生成质量。
探索更多,推理更佳:面向扩散语言模型的逐步风险敏感GRPO
提出StepRS-GRPO,随去噪状态调整风险系数,提升扩散语言模型数学推理准确率、覆盖率和多样性。
低损失区域错位导致Grokking
本文提出低损失区域几何框架,发现训练与验证的低损失区域错位导致Grokking,并给出反例。
STAGE:面向文本到3D模型的子空间靶向仿射生成擦除
免训练闭式分阶段文本到3D模型概念擦除:按类型校正结构/外观,TRELLIS得分66.7胜53.2。
ITC-MoE:面向MoE扩散语言模型的重要性引导Token感知压缩
提出ITC-MoE,结合重要性引导Tucker压缩与Token感知补偿路由,降低MoE扩散语言模型开销并保持生成质量。
群不变统计决定嵌入几何:从巴赫到夜空的表示调和分析
群不变共现统计决定嵌入几何:表示由不可约表示矩阵元构成,统一解释月环、五度圈与天体球谐。
无需模型:文本熵率过滤缓解迭代微调坍缩
无需模型,文本熵率过滤缓解迭代微调坍缩:六代实验显著提升合成数据多样性、降低重复,优于对数概率过滤。
当裁判行动时:审计文化情境提示下VLM引导的图像选择
审计VLM裁判:4B近随机、位置偏差大,重排序改变六成选择;8B超CLIP,但一致性过滤须随裁判更换重审。
AURAL:面向语音语言模型的自适应潜在推理与联合分块
AURAL用自适应潜在推理与联合分块,降低语音模型首答延迟11.8倍,并构建68.3万条双语推理数据。
量化与高效适配的蛋白质语言模型分析
4比特量化与QLoRA能显著降低蛋白质语言模型显存占用,多数任务保留九成以上性能,生成任务需分布验证。
ShelfChange3D:面向零售货架监测的对象级3D变化检测
将货架监测定义为对象级3D变化检测,提出数据集与端到端框架,实现精准3D定位,性能优于现有基线。
该选哪个大语言模型?面向大语言模型的在线主动模型选择
首个在线主动大语言模型选择框架,有限标注挑最有信息提示,省标注成本达71.67%,降后悔2.51倍
PickMoment:通过学习去模糊与模糊到视频实现连续时间单图到视频
提出PickMoment,直接学习曝光任意子区间均值模糊,单模型统一去模糊、模糊到视频与连续时刻恢复,性能领先。