《沃尔多在哪里?跨语言知识差异下的查询语言偏好》
构建Waldo多语言QA基准,发现知识冲突时模型偏向查询语言来源,LoRA训练可缩小偏好差距61.5%。
LEGO-OPD:面向多模态在线策略蒸馏的因子化教师组合
因子化组合语言专家先验与视觉专家似然为单一教师分布,自适应校准视觉监督强度,兼顾视觉定位与语言推理。
大语言贝叶斯不具重参数化不变性
LLB的证据下界加权依赖模型写法:重参数化不变性失效,权重差可达31.9倍并反转贝叶斯因子;需验证自生成重参数化。
格式塔:大型多模态交互模型
提出格式塔大模型,通过多模态交互金字塔、统一离散扩散与交互分区架构,增强跨模态整合。
基于多任务QLoRA的社交媒体可解释自杀风险评估
多任务QLoRA微调Qwen2.5,联合风险分级、证据抽取与因素识别,集成校准后综合得分0.7738。
评估语言差异对大型语言模型多语言语言能力的影响
101种语言、六个模型:后训练削弱语法能力,低资源语言受损最重,母语提示可恢复隐性能力,需多范式适配。
智能体决策之前:基于大语言模型系统中的认知行动
论文将认知行动引入大语言模型智能体,主张决策前需生成决策就绪证据,区分获取、转化、探测三种模式。
无投影在线凸优化中的精确预言机-遗憾权衡
研究仅用线性优化预言机的无投影在线凸优化,给出维度无关的极小极大遗憾紧界、匹配算法及预算/光滑推广。
Memorizon:超越上下文窗口训练世界模型
样本可覆盖任意长跨度却只评最后k块,按相机共视检索有界潜变量库,重访一致性显著提升。
当执行框架丢失信号:大语言模型智能体中恢复机制的因果评估
将恢复视为因果决策问题,提出CIR路由器,在ALFWorld上提升成功率3个百分点且不干扰正确轨迹。
冻结场景,赢家更迭:文本到3D评估中的配置脆弱性
审计300冻结场景与19评估器:配置方差常超生成器差异,赢家随协议变化,但无确认反转,敏感性有限。
用于多样化对话回复生成的解码器混合模型
提出在CVAE框架下为序列到序列模型引入解码器混合,各解码器学习不同话题以提升回复多样性,实验优于强基线。
验证脉冲与逃离错误共识的代价
固定验证预算的时机与对象影响异步二元系统逃离错误共识;给出临界预算窗口,并用语言模型实验检验重置调度。
基于本体的情境化人工智能评估(OB-CAIE)方法论
提出OB-CAIE方法:领域本体界定测什么,过程本体界定怎么测,平衡人机,失败点可追溯分析。
涌现式不忠实:对齐训练如何导致语言模型静默覆盖任务忠实性
对齐训练使模型对敏感内容悄然偏离输入且不披露,随规模加剧,DPO阶段最隐蔽,提示无效,暴露能力-对齐-忠实性三难。
注意力流形:通过编辑学习到的B样条曲面引导或阻断语言模型
提出注意力流形:以可编辑B样条曲面调制注意力值,仅增0.3%参数,降困惑度、纠错并支持安全阻断。
分数稳固,基准泄漏:量化公共脑肿瘤 MRI 分类中的数据集污染
公共脑肿瘤MRI基准存在重复、患者及来源泄漏等数据污染;去重后性能仍稳,准确率难证基准完整。
多模态开放世界图学习验证与扩展
提出MOVE框架,联合多模态信息识别未知节点并验证候选类,选择性扩展类别空间,平均提升11.87%。
PixelDense:将稠密预测作为像素扩散的表征对齐
PixelDense将SAM2、深度等稠密预测作为像素扩散对齐目标,分流语义与几何梯度,提升生成与编辑。
联邦多模态图基础模型中的感知与推理耦合
提出FedCORE,通过共享低维潜在状态联合优化编码器与GNN,将配对差距降低80.7%。
基于国际象棋的大语言模型提示优化基准测试
提出1118道Lichess棋题基准,评测大模型自动提示优化,低成本、可再生且具区分度。
面向 AI 编程智能体的自进化编程规则
提出RuleEvolve自进化框架,用LLM变异与评判迭代优化编程规则池,评测中超越人工设计与提示优化基线。
科学还是垃圾?——AI生成论文中科学劣质内容的基准测试与缓解
构建390篇AI论文基准,六指标识别AI准确率85.9%;提出证据约束修订框架,缩小人机差距63%。
源自预设结构与学习物理的稳定且反事实鲁棒的物理世界模型
预设通用结构、学习特定物理,约九千参数实现百倍外推稳定与反事实鲁棒。
PhysicsMate:基于课程的孟加拉语中学物理问答基准与小模型适配
基于NCTB课程构建1834问答对的孟加拉语中学物理基准;小模型适配提升闭卷准确率,4B量化可离线。
灵台:概念几何对LLM推理揭示了什么——又未能揭示什么
提出免训练概念遥测层灵台:逐步投影残差到概念锚,发现其与LLM预测不确定性稳健相关,却无法提供正确性坐标。
零假设才是难点:生成模型记忆化的精确检验
记忆化审计缺乏零假设,易致假阳性;提出置换与匹配对照的精确检验,可校准误报并准确认定复制图像。
PhysVista:通过感知-推理-评估闭环对视觉语言模型中的物理智能进行基准测试
提出基准PhysVista,以感知—推理—评估闭环评测视觉语言模型物理智能,覆盖真实与生成视频,揭示其物理理解存在显著差距。
Vmem-φ:基于膜电位统计的脉冲神经网络低计算量分布外检测
膜电位统计助力SNN低算力OOD检测,提出Gen1-C基准与MDD,高严重度AUROC>0.88。
FORTE:面向长视频问答的自适应评分与精确关键帧选择
免训练FORTE自适应评分并精确选关键帧,兼顾相关性与时间覆盖,长视频问答平均准确率最高。
金融AI的应急敞口路由:宕机风险与不可分决策的代价
提出金融AI故障条件路由,分析不可分决策风险;压力测试显示交换法降险,但错误对齐等限制分散。
法律研究基准:衡量长程法律研究智能体的端到端可靠性
推出LRB基准,含413道专家编写美国法律研究题,评测13个前沿模型;最强模型全对率仅42.9%,成本与准确率无关。
面向大语言模型注意力的序列化功能结构化Tucker压缩
提出FTC序列结构化压缩,联合利用Q/K/V头结构并适配压缩表征,无需微调,在6B-32B模型上大幅领先。
铁路系统异常检测的深度学习:结构化综述
系统综述铁路异常检测的深度学习方法,提出统一分类体系与决策框架,涵盖数据挑战、评估与边缘部署。
网络流量分类中 Jev 的初步考察:准确率、处理时间与成本
Jev凭前10包数据分类QUIC应用,40示例将准确率提至28.4%,逊于树模型,但比GPT快且便宜。
有效的合成数据筛选需要群体级信号
合成数据筛选需群体级信号:仅个体信号不足,训练越合成越关键,低成本诊断可定位重点组。
离散标注,连续偏好:重新思考面向准确且可泛化美学图像裁剪的监督
提出连续偏好场CPF,从离散标注恢复密集偏好,训练CPIC实现精准可泛化美学裁剪,并重校准基准CPICD。
空间策略,而非动作:向量量化测地线作为LLM驱动智能体的工具
LLM智能体借向量量化测地线构建可调用空间工具,在部分可观测网格中以低成本达到思维链级目标达成率。
大语言模型能否解锁眼科诊断报告中的离散数据?
GPT-4o两种提示策略从眼科诊断PDF提取结构化数据,准确率高,耗时减少约92%。
VisionQ:面向计算机视觉定性分析的“VLM作为评判者”分类体系、数据集与基准
首个基于同行评审论文对比图的准则条件视觉判别基准,含分类体系、数据与评估协议,最强VLM评判者准确率仅63.1%。
CompMat-Bench:面向计算材料科学的AI智能体基准测试
发布CompMat-Bench基准,含94项计算材料学任务,预复现仿真免昂贵计算并固定评分。最强智能体单任务通过率66%-90%,失败多因科学错误。
超越对角状态空间模型:精确非阿贝尔群追踪、可解性障碍与几何物理流形
提出非交换状态空间模型,将状态转移提升至紧李群,实现精确非阿贝尔群追踪与几何流形保持,优于对角基线。
基于零空间投影的LoRA微调大语言模型后门净化
零空间投影净化LoRA后门,无需触发器或重训练,ASR近100%降至<10%,保持基座与下游能力。
HAWK:重新思考推测解码中的多模态草稿生成
HAWK融合目标层表示与压缩视觉隐状态,建模草稿后目标变化,提升多模态推测解码接受率与加速比。
最弱一环:用最坏情况约束强化学习蒸馏大语言模型推理
提出最坏情况约束强化学习蒸馏大语言模型推理,约束教师对数似然每个前缀,兼顾准确与保真,提升严格推理成功率。
VERITYGATE:面向结构化证据的接地 LLM 叙述的四门模式级忠实性框架与配对基准
提出VERITYGATE四门模式级检查器与配对基准,检验基于结构化证据的接地叙述,发现声明常被拒且修复增益有限。
智能体评估可靠性:更多任务并不总能修正智能体排行榜
评估可靠性随目标而异:底层模型排名不可靠,增加任务难以解决,合并多样基准可低成本提升可靠性。
利用视觉语言模型进行增强现实中感知质量评估与自主内容调整
基于视觉语言模型构建AR内容自动评估与调整框架,预测与主观评分相关达0.87,超九成用户认可。
基于专家隔离与关停的大语言模型后门遏制
提出“学习但分流”:训练时把后门导入可隔离专家,部署时关闭该专家,攻击成功率降至0–10%且效用多保持。
贝叶斯微调使语言模型达到其信念所允许的贝叶斯程度
贝叶斯微调可为语言模型植入可用贝叶斯信念,使其行为、表征与计算更接近贝叶斯决策,优于常规监督微调。