Groundbench:多分辨率多边形定位揭示视觉语言模型的几何差距
同一数据改测五档顶点多边形,最强模型框IoU 88.2,直接多边形仅57.7,暴露输出几何差距。
FLEET:从 Logits 熵到文本生成中的增强轨迹
FLEET为LLM引入记忆,以稀疏轨迹调整logits,同精度提速3倍并提升复杂编码准确率。
基于风险敏感与评论家一致性正则化的鲁棒对抗强化学习
提出RACER框架,以风险敏感视角改进对抗强化学习,自适应调节扰动并正则化评论家一致性,提升鲁棒性与稳定性。
VIVAS:以视觉-语言统一自回归监督激活 VLM 预训练中的视觉感知
VIVAS以统一视觉语言词表和自回归监督,增强VLM细粒度视觉感知,在39项多模态基准达SOTA。
评估大语言模型生成的学生写作反馈中的反馈焦点与教学适应性
研究LLM写作反馈焦点与教学适应性,发布FeedType基准;其类型覆盖广,但分布和适应性不及教师。
你被告知了多少?测量同行评审中的外部信息
提出自条件化信息论估计器,测量评审外部信息,高精度区分代写与润色。
NS-ATTENTION:视觉Transformer中注意力输出的牛顿-舒尔茨变换
提出NS-Attn,无参变换视觉Transformer注意力输出,降低谱集中度并提升有效秩,多个模型和数据集上平均提升0.25-0.83个百分点。
MENO:内存高效的神经算子
MENO是基于流形函数编码器的PDE求解器,内存与分辨率无关,支持任意几何离散,泛化强、精度高。
AgentHazard:评估计算机使用代理有害行为的基准
AgentHazard基准含2653个实例,评估计算机使用代理的累积性有害行为。实验发现当前系统高度脆弱,Claude Code攻击成功率达73.63%。
SAGE:面向结构感知联想记忆的自演化智能体图记忆引擎
图记忆作为动态长期记忆,写者构建、读者检索反馈,自演化提升多跳问答与检索效率。
BixBench3:在科研级计算生物学任务上评测AI智能体
BixBench3评测AI智能体端到端完成计算生物学研究的能力:20项任务中前沿模型得分仅0.00–0.48,数据量越大、步骤越多,表现越差。
ScholarStack:面向科学智能体的分层研究资产编排与跨任务复用
该系统将论文集编译为分层可溯源研究资产,支持科学智能体跨任务复用,提升跨论文任务质量并降低查询开销。
多智能体大语言模型辩论究竟改变了什么?对分歧与答案质量的分层分析
多智能体辩论易改变智能体的表态,但缺乏持久立场变化与最终答案质量提升的证据。
极限核 Q(λ):弥合短视界与长视界
提出极限核Q(λ)离策略价值估计器,融合n步截断与极限核长视界近似,复杂度同n步,长视界任务优于基线。
重写而非仅蒸馏:面向持续视觉语言模型后训练的参考驱动修订
让模型以专家答案为参考修订自身错误轨迹,校验通过后微调,新任务提升56.9分且遗忘降低11.3倍。
TARL:面向长期智能体可执行记忆管理的事务感知可靠账本
TARL将记忆更新细化为五种可执行动作,借对比式训练提升动作预测与状态恢复,减少记忆污染并保留冲突证据。
基于自监督语音模型的二语发音偏差母语参考坐标几何
提出母语参考坐标几何,以自监督模型音素类均值构建参考空间,用距离评估二语发音,距离与熟练度负相关。
知识库驱动的实体集分类扩展导航
知识库驱动的实体集分类扩展中,提出扩展图并形式化节点可比性推理,揭示复杂度边界,支持局部增量导航。
TEMPS:面向时间信息检索的时间句子嵌入
提出时间文本相似度任务与TEMPS模块,以时间锚定和高斯匹配增强检索时间对齐,提升时序检索性能。
面向可信智能体网络的分布式法律基础设施
提出分布式法律基础设施,以身份、约束、裁决、市场规制和可移植制度五层,保障可信智能体网络合法性与问责
超强机器学习:大语言模型生成的解释尚不足以向人类传授主动学习策略
USML管道用ILP+LLM自动生成解释,人类试验中未优于自学,LLM评分难预测学习成效。
表格基础模型在上下文中计算什么?通过注意力门控更新实现原位表征精炼
提出原位表征精炼:支持标签引导注意力门控更新并迁移至查询,表格基准超TabPFN-3。
在检索与硬件约束下评估面向土耳其语领域文档的开放权重大语言模型
6GB显存评测5个7B-8B模型,土耳其语文档问答49%-75%;检索未显著优于字符基线,三者需分评
激活记忆与参数记忆在少样本学习中的互补作用
激活记忆擅长事实回忆,参数记忆未必更优;复合任务需两者协同,模型调用不同且叠加的神经元。
全球建筑物与居民点数据集在不同地理与聚落情境下的比较评估
基准评测七套全球建筑数据集:Overture矢量F1中位数最高0.786,栅格精度随分辨率与建筑密度变化,时间对齐可使精度提升。
大语言模型能识破被操纵的回测吗?一个干净对照校准基准
96组配对回测基准含干净对照;高召回模型仍误报93.8%干净代码,加干净感知提示后误报归零、召回不变。
基于梯度归因的上下文感知机器翻译注意力头规模化分析
提出基于梯度的注意力头归因,支持大模型大规模因果分析;在上下文机器翻译消歧中揭示通用头与冗余。
MotionSpec:面向运动一致视频生成的谱轨迹监督
提出MotionSpec框架,通过谱轨迹一致性与局部光流一致性监督,提升视频生成的运动一致性与时序连贯性。
视觉绊线:预判深度视觉系统的失效
提出视觉绊线框架,利用表征漂移、预测振荡、轨迹曲率与注意力熵等时序不稳定信号,提前预警深度视觉系统的失效。
全局树预测器在层级聚合上崩溃:基于五个面板的失效刻画
全局树模型预测层级汇总崩溃,最多低估496倍;按序列缩放、加权聚合行或季节差分可防。
迈向高效推理:为扩散语言模型学习因果捷径
提出因果捷径学习框架CSL:提取因果捷径并优先掩码训练,提升扩散语言模型推理准确率与收敛速度。
面向翻译的大语言模型微调:通用遗忘缓解无法保持机器翻译特有指令遵循
翻译微调提升质量却致遗忘;通用缓解法难保机器翻译指令遵循,仅数据混合可保控制但不泛化。
当自适应造成伤害:联邦可穿戴设备新用户接入中的划分敏感性与个体级负迁移
严格防泄漏评测六种联邦可穿戴新用户适配:均值准确率掩盖个体负迁移,无策略全面占优。
基于隐式神经表示与扩散模型精化的牙科锥形束CT视野扩展
提出三阶段框架:隐式神经表示补全截断投影,迭代重建提升解剖一致性,扩散模型精化图像,有效扩展牙科CBCT视野并减少伪影。
ZoomDiff:面向双摄像头平滑变焦的高保真扩散模型
提出高保真扩散模型ZoomDiff,融合双摄潜空间与像素空间,提升双摄平滑变焦的几何一致性与高频细节。
什么变了?真实、虚拟与不可比诊断的漂移检测
将条件双判别器差异迁入嵌入空间,同时消除旋转与标签置换盲区,实现更优漂移检测与类别发现。
学习检测符号模型失效:机器学习与 Black-Scholes 的局限
基于260万期权合约,树模型优于核PCA,专家特征更佳;偏差反映市场结构而非模型假象。
CAST:基于上下文与异常结构条件的时间序列异常生成
CAST框架:两阶段预训练与微调,借正常数据学系统动态,以异常结构为条件生成异质异常,性能超越现有方法。
任务诱导的视觉Transformer特征空间黎曼度量
提出任务诱导黎曼度量与谱拉回网络,将低秩度量蒸馏为重要度头,几何化token剪枝使深度误差降低25%。
计算优于几何:语义同一性是算出来的,而非嵌入自带的
语义同一性并非嵌入的几何属性,而是两句话共享一次前向传播时的联合计算结果;独立编码近乎随机,联合可达0.9以上。
精确极小极大一比特无偏压缩:重尾必然性与有限随机性近似
证明一比特无偏压缩极小极大下界与随机阈值码达到,揭示高斯最优需临界重尾,并给出有限随机比特近似与优化保证。
数字双言现象:阿拉伯语在X与Facebook之间
研究X与脸书上的阿拉伯语双言,发现平台和话题显著影响标准语与口语选择,数字时代重塑而非消除双言界限。
评估选择决定预测排行榜:来自生产市场面板的证据
评估设计选择(分析单元、误差汇总、区间评分)可逆转预测方法排名,并在M5复现。
AstraLOD3:LOD3建筑模型的零样本多模态智能体重建
AstraLOD3以多模态智能体零样本重建LOD3建筑模型,35次运行媲美专用方法。
提示、探测、训练,还是标注?业余场景下的单摄像头体育视频理解
业余单摄像头排球评测显示:无单一范式各阶段通吃,身份识别最难,规则可补像素不足。
部署前预测量化价格以选择PTQ配置
将权重空间PTQ建模为部署前配置选择,以满精度模型为层输出误差定价,生成校准时价格表做预算选择。
精确反馈≠可控:评估大语言模型中的文本闭环修订
精确反馈难保闭环修订可靠:19模型完整反馈下成功率17.4%–99.8%,失败常重复旧输出。
从推理字符串到偏序:通过商策略优化的验证器认证规则迁移
VCRT重放相邻操作,认证可交换轨道并保留真实依赖,跨环境迁移宏通过率77.60%,超基线64.53%。
共享编码器并非共享任务:深度专家池的条件化比较
共享编码器不等于共享任务;条件双判别器嵌入差异可消除旋转虚高与标签置换盲区,双轴门控决策更优。
LiAM-SAM:面向鲁棒SAM2多目标跟踪的生命周期感知记忆
将多目标跟踪视为生命周期记忆完整性问题,针对初始化、漂移与重识别设计机制,实现最优HOTA与IDF1。