可靠但设计敏感:大语言模型标注中的工具不确定性
大语言模型标注可重复,但换任务设计或模型即变,称为工具不确定性;置信度不能替代多设计比较。
MSU 团队 GenText-Forensics 2026 挑战赛技术报告
提出分解式思维链流水线,结合篡改检测器与双视觉语言模型,获挑战赛第三名。
深入CHOIR:自由列举式引出揭示大语言模型集成中的独特模型之声
提出CHOIR框架,以自由列举法探测LLM集成,区分表层共识与深层差异,识别各模型独特声音。
AIM:面向自动化研究的智能体式想法管理
提出AIM框架,用智能体代理与采集机制组织并优选研究想法,维护想法与实现一致,动态分配预算,优于基线且快3.1倍。
超越层级:统一多模态模型的位置分辨梯度冲突与位置感知调制
发现生成-理解梯度冲突随视觉token位置变化,提出位置感知调制,仅在高冲突位置去除反对齐梯度,提升统一多模态模型性能。
MILO:通过编排式多智能体演化实现自动化智能体执行框架发现
MILO以编排式多智能体演化,协同发现更优智能体执行框架与搜索策略,多基准超越SOTA并刷新数学上界。
通过受控环境干预构建具有挑战性的浏览器使用任务
用受控环境干预把难度变为可编程属性,构建BreakingWeb基准:519对任务使智能体通过率降22.9%,失败多为虚假成功。
VidHarness:面向低成本长视频理解的可进化智能体框架
VidHarness以MCTS进化智能体框架,借多保真验证与混合路由降本,在多项长视频理解基准上刷新SOTA。
τ-多语言:跨语言语音智能体基准测试
推出τ-多语言基准,覆盖五种语言全双工通话评测:韩语、普通话完成率明显落后,失败模式各异。
解码延迟反馈预填充:一种无模型控制器及其泛化极限
无模型控制器DLFP以解码延迟反馈调预填充分块,A100上P99令牌间隔降27.7%,但泛化受限。
无需训练的合成:面向表格、时序与关系型合成数据的纯推理流水线
免训练纯推理流水线:统计画像与语言模型约束生成可审计采样器,统一支持表格、时序和关系数据。
基于可回收单元门控的循环神经网络动力系统持续学习
提出可回收单元门控CRUG:L0门控选择并回收任务单元,零遗忘持续重构动力系统,兼顾容量,可迁移至认知任务。
PrimeSeeker:面向能力的深度搜索智能体监督
提出潜在锚点推理与PrimeSeeker框架,以锚点结构生成问题及证据骨架,监督并强化训练,减少检索冗余。
PrivMeSA:面向医学的隐私感知自演化多智能体系统,基于本地—远程大语言模型协作
本地智能体以强化学习平衡准确率与隐私风险,用经验记忆复用远程知识,披露率由98%降至0.2%。
MOBA-VL:面向实时MOBA解说的赛事事件定位多轮强化学习
MOBA-VL以遥测定位事件、多轮强化学习训练9B模型,实时解说总分领先,事件召回率升至42.1%。
LoopVL:循环视觉智能
LoopVL将循环Transformer扩展至视觉语言模型,共享模块迭代更新多模态状态,性能超越更大模型并现视觉顿悟。
从随机探索中学习规划
仅凭随机探索,用条件能量模型学习多尺度时间关系,无需动作与奖励标签,实现长程迷宫规划与导航。
追踪语言模型中谄媚性认同的机制
因果中介分析揭示,早期少数注意力头把用户观点注入残差流并偏置答案;消融可显著减谄媚而不损准确性。
可听世界模型:面向3D世界的空间感知声音生成
免训练框架将声音融入3D世界:语义分层定位声源并锚定几何,渲染随听者移动的空间音频,空间一致性更强。
更少均匀的离散扩散更强大且可扩展
提出LUDI:非均匀损失加逐词元时间嵌入,提升少步生成;7B模型可复杂推理,比自回归解码快3词元/步。
PAMI:面向文本到人体-物体交互生成的部位锚定运动框架
PAMI用身体部位锚点投票定位物体运动,粗到细生成并细化接触几何,接触召回率较此前最佳提升14.5%。
论同策略蒸馏中的异策略教师
同策略蒸馏中教师监督学生前缀为异策略;SCOUT协同训练教师适配,提升蒸馏效果。
我们还能信任灾害社会感知吗?检测人工智能生成社交媒体帖子的实证证据
实证表明,文本AI检测难辨人类与AI生成灾害帖,不宜作信任门槛;需多模态、可问责来源等证据。
面向任务特定视觉感知的合成数据策划
核心不是生成更多,而是生成什么:按任务设计场景、外观与标注;程序化渲染、物理仿真与生成式AI各有所长,须与真实数据互补。
LeanPolish:面向Lean证明压缩的经核验监督
发布3.3万条经验证Lean编辑与候选池,揭示首次成功搜索捷径;符号迭代与微调提升压缩和整证明重写。
面向射频逆向设计的模拟器精炼扩散
提出模拟器精炼扩散SRD,用可微代理梯度引导、高保真模拟器精搜,射频逆向设计S参数匹配最高提升21.2%。
哪些任务能在自监督学习中幸存?
研究同实例自监督学习的信息保留,用语义可恢复性及谱子空间刻画下游任务几何与少样本迁移。
基于视觉语言模型街景描述的行人路径感知安全估计
以视觉语言模型街景描述作可解释中介,估算感知安全并规划行人路线;实地验证相关性有限,基准提升未带来现场增益。
面向基于图像的连续控制的高斯与Beta策略分歧正则化模仿学习
DRIL将策略分歧转为强化奖励,少示教图像连续控制显著优于行为克隆;示教增多优势缩小,β行为克隆强。
梯度冲突能否预测理解—生成权衡?统一多模态模型中冲突度量有效性的受控审计
受控审计发现,梯度冲突指标与理解—生成权衡无显著相关,抑制冲突不改变权衡,其诊断有效性需验证而非假设。
ShamAN-Q:面向亚1比特LLM权重的Shampoo增强NanoQuant
提出ShamAN-Q亚1比特量化法,以稠密曲率替代对角几何,降低困惑度并提升零样本精度。
VAmoS Part Deux:更难、更真实的语音智能体仿真
VAmoS Energy基准含100通多请求语音客服电话,测试14种语音栈,完成率17.3%–44.7%,背景电视干扰降至8.6%。
解决金融数据缺失危机:面向SEC 10-K提取的生成式AI流水线
评估多款LLM从SEC 10-K提取四类财务数据,规模匹配复杂度可提高零样本准确率,消除数据缺失偏差。
超越上下文窗口:面向混合检索与长上下文语言模型的自适应熵驱动路由框架
提出EDAR,以预测熵推理时路由RAG与长上下文,保留97.4%精度,token开销降70.7%。
理性与敏感性:以医师专家为基准评估大语言模型的临床分诊建议
基准测试显示,LLM较医生更易建议不必要诊疗,且对性别与语气等临床无关扰动更敏感。
大语言模型组合任务中的因果与可解释结构
LLM组合任务中,关系信息随层从两词联合表示渐进组合为三词表示;因果相关表示可提升下一词预测。
AgBench:面向个人AI设备的智能体AI基准测试
提出AgBench基准套件,评估个人设备上智能体AI的本地、混合与云端执行,揭示成功率、延迟、成本与数据暴露间的权衡。
Aperture:面向遥感的免训练多尺度概念瓶颈
APERTURE:免训练多尺度概念瓶颈,融合四叉树路由与MLLM评分,在遥感SiFC上超越免训练和监督基线。
GazeFlow:从人类注视行为到生成式第一人称注视预测
GazeFlow将注视建模为任务与视觉显著性条件下的联合分布,用条件流匹配生成轨迹,性能达SOTA且更符合人类注视动态。
CruxBench:信息发现基准
CruxBench以信息价值评估LLM发现关键子问题的能力,前沿模型仍表现有限。
预训练与中期训练让什么可从奖励中习得?
预训练与中期训练提供可执行计算与检索,使奖励学会任务特定用法;源监督和记忆回放大幅提升成功率。
ThinkV2V:释放多模态大语言模型推理能力,实现指令引导的视频编辑
ThinkV2V让MLLM先推理再生成视频,结合渐进课程训练与推理时思考扩展,5B模型超越10B基线。
PACT:面向单 token 类型化决策的成对锚定校准调优
PACT将对比对的四项结构约束转为训练目标,提升单token类型化决策的稳健性与排序精度,精度持平而偏差更低。
除了关键时刻几乎与人无异:VoxParity 与声音本应改变的决定
VoxParity测试语音智能体:14行业183场景中仅11/23通过,错误偏向文字,规则提示仅部分弥补。
超球语义轨迹分析:映射学术预印本、专利信号与算力扩展中的技术扩散
提出超球语义轨迹分析,追踪预印本与专利技术扩散,发现大语言模型等子主题语义演化最快。
走向“模型即库”:面向低资源非洲语言的离线社区共建AI
提出MaaL:将社区录入的小型语音模型作为端侧依赖,实现离线、防幻觉的数据收集,服务低资源非洲语言。
LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation
面向高效视觉推理的问题特定知识图谱
提出VisKG:用强化学习把视觉内容转为问题特定知识图谱,滤噪保留推理结构,token更少且更准。
临床试验中人类—AI交互的定义与分类:一种多维人类—AI分类方法
提出多维框架分类临床试验人机交互,涵盖AI任务、人机关系、交互配置与人群;LLM辅助分类需人类判断。
人口统计多元主义:多元人类偏好分布的推理时建模
提出人口统计多元主义推理时框架,无需微调估计群体意见分布;JS距离降8.4%-26.4%,等权聚合最优。