MVVBench:面向视觉语言模型的4D推理基准评测
真实多摄像机多视角推理基准,题目单视角或单时刻均不可解,覆盖六类能力,暴露模型时序定位与跨视角身份缺陷。
DAPEVO:深度自适应块帧-事件视觉里程计
DAPEVO在共享块位置独立估计图像与事件对应并融合证据,RGB帧稀疏时仍稳健,精度显著优于现有方法
HasMem:面向长期LLM智能体的硬源自适应软化记忆
提出HasMem:冻结硬提示作初态,控制器调记忆宽度,写入器重编码,读写器全局适配,提升F1并降低NLL。
FAVoR:度量与缓解联邦个性化生成中的作者风格同质化
联邦个性化生成中,标准聚合会抹平作者风格;FAVoR用共享-私有适配器保留作者残差,提升风格留存。
共享智能体记忆中认知准入的基准与诊断研究
提出CPB基准评测共享记忆的声明准入,发现缺乏源谱系的策略难以拒绝虚假声明。
PTC-Decoder:迈向离线资源受限边缘设备上的智能小语言模型
免训练即插即用PTC-Decoder,以规划为工具并用有限自动机约束工具名,提升边缘小模型多步任务可靠性。
为何扩散语言模型中的越狱能够成功:能量景观分析
提出能量景观框架,将越狱归为初始模糊或中途跨越,导出三个免训练检测信号,实验验证互补有效。
在储备池计算框架下对秀丽隐杆线虫连接组进行基准测试
用储备池计算基准测试秀丽隐杆线虫连接组,发现生物连接与仿生配置未必更优,随机对照常更优,且受配置与来源影响。
SkillEvoReg:为智能体技能演化抵御过拟合的正则化
提出SkillEvoReg正则框架,缓解智能体技能演化过拟合,抑制冗余膨胀并保持能力。
生产规模下的自动研究:失效模式与多智能体框架
生产级AutoResearch揭示五类失效模式,提出“预防-持久-重定向”框架,召回率提升1.82倍。
IDM-Net:一种用于低光照图像增强的轻量级光照解耦调制网络
IDM-Net用双编码器提取RGB外观与亮度光照先验,经光照引导调制实现亮度与色彩的平衡,轻量高效。
耦合用法—义项过程:时序性与可归因的词汇语义变化
提出CUSP,从单一时间过程同时揭示词义变化的幅度、时间、机制、成分移动与文本归因。
在线凸优化中带指示切换成本的动态遗憾
提出元学习算法,在指示切换成本下实现动态遗憾近最优界,无需预知比较器切换数或路径长度。
GyroNovo:面向从头肽测序的误差引导片段插补与质量感知注意力
GyroNovo利用解码误差引导缺失片段插补,并以旋转嵌入编码峰间质量差,显著提升从头肽测序精度。
TISD:带轨迹干预的在线策略自蒸馏
提出TISD:教师选分支、学生续写、特权教师蒸馏全轨迹,缓解在线自蒸馏数据瓶颈并在编程和科学任务提升。
思考有助于公平吗?推理标记解决了一些偏见,却制造了更多
思维对反事实公平有不对称双重效应:在九个模型-数据集组合中,新产生的偏见翻转约为被解决的5倍。
对称正定流形上函数型数据的几何特征学习
提出MatFAE,从对称正定流形函数轨迹中学习动态表征,兼具可解释性,并用于fMRI分析。
求解下层非凸的双层优化,需要二阶平稳性
提出二阶平稳替代及PROBE算法,解决下层非凸双层优化,逃离鞍点且有限时间收敛,实验优于SOTA。
何处与何时强制:面向流式虚拟人的路由式强制
按语义区域与噪声阶段路由蒸馏,人物/高噪用DFD,嘴部/背景/低噪用DMD,提升动态多样性并保质量。
自监督感知可解释的单目深度估计
提出自监督框架PIMDE,分解图像为感知特征图并分支估计、融合,KITTI上兼顾精度与可解释性。
《CG-Probes:从患者查询嵌入中恢复护栏方向》
提出CG-Probes,在冻结嵌入空间以均值差法探测三条风险轴,可媲美开源LLM且延迟极低。
FARE:面向诱饵替换式图像生成器检测的取证接受域估计
提出FARE,利用生成器特有伪影构建接受域,仅凭单张图像即可检测部署时生成器被暗中替换,优于基线。
算力用在何处:面向高效视频扩散的异构注意力
提出HetA-DiT异构注意力,按token去噪难度自适应分配算力,仅约20%token走稠密注意力,兼顾质量与效率。
逻辑树引导的检索增强生成用于长篇幅专利撰写
提出逻辑树引导的检索增强生成框架,以层次化逻辑树组织技术披露,实现可控且章节均衡的专利长文生成,内容质量与语言合规性优于基线。
SciHorizon-eLab:面向科学具身智能体可扩展基准测试的智能体式协议到任务编译器
提出协议到任务编译器SciHorizon-eLab,将实验协议编译为可验证具身任务,构建300项基准任务,最强策略成功率仅49.7%。
OpenHail:面向电动网约车车队控制的事件驱动 Gymnasium 环境
开源Gymnasium环境OpenHail,支持电动网约车车队的订单分配、调度与充电联合控制。
JevSoup:面向免训练 LoRA 组合的系统一路由
JevSoup 免训练框架分离路由与执行,仅凭输入与专家描述选两专家,正交投影等权合并,14项任务精度最高提升1.21%。
STORM-Bench:在演化且不完整证据下评估在线视频问答
STORM-Bench评测证据演化且不完整的在线视频问答;14个模型准确率最高60.3%,可靠性却仅5.7%–35.6%,普遍过度自信。
ZooWork-ShopRanker:一个开放的、偏好对齐的电商重排序器
提出0.6–8B偏好对齐电商重排序器,LLM评判标签加蒸馏,发布ShopRank-Bench。
PixSim:分析师容量约束下即时支付欺诈、追回与拦截的校准开源模拟器
开源校准的Pix模拟器,在分析师容量约束下模拟即时支付欺诈、追回与拦截,并评估策略。
PhoenixSR:生成式异构蒸馏赋能高效真实世界超分辨率模型
PhoenixSR以生成式异构蒸馏迁移扩散先验至前馈超分网络,推理无扩散开销,多骨干感知提升、保真度保持。
在网页图上训练图基础模型
提出Acacia:在网页图上从头训练,免额外训练支持任意特征与多任务,具上下文学习,不依赖LLM。
从点击到跳转:以应用原生深度链接增强移动GUI智能体
提出混合交互新范式:深度链接直航、GUI操作兜底,构建验证目录GUI-Hopper,提升真机任务成功率。
面向虚拟传感的神经算子节能运行
神经算子复用空间计算降低虚拟传感更新能耗,高频下省约20%,固定功耗下最高省22.5%。
LLM智能体社会中的金融脆弱性:协调失败与稳定机制
LLM智能体在金融环境中易现集体脆弱;三类承诺机制可缓解,但需早期广泛承诺方能稳定。
FLIP:面向视觉-语言模型的最终层推理时探测
提出FLIP最终层推理时探针,验证VLM内部干预是否支持结构化任务计算,而非一般性扰动;属验证非引导。
MACBT:具有纵向记忆的多智能体认知行为疗法决策支持系统
面向临床医生的MACBT多智能体CBT决策支持系统,结合纵向记忆,提升专业性与跨会话连续性。
LocUS:面向定向激活引导的注意力头选择与子空间投影
LocUS将激活引导限制于输出词表子空间,仅调<6%参数,能更好控制毒性、情感与谄媚且保住通用能力。
G$^2$PTQ:通过广义梯度补偿改进大语言模型训练后量化
G$^2$PTQ提出统一训练后量化框架,融合一阶与二阶梯度信息,动态刷新Hessian并稳定补偿,性能优于现有方法。
面向大语言模型推理的自对弈搜索蒸馏
以自对弈搜索生成超人类思维链,蒸馏训练大模型,提升数学推理与博弈胜率。
QSV:用于球面格上耦合四元数注意力的四元数球面视觉
QSV以每token单位四元数替代QKV,在球面kNN图上耦合注意力与特征传输;消融显示传输关键,几何增益不明显。
PICO:面向六自由度手术器械位姿估计的投影信息引导一致性优化
端到端PICO预测分割、深度与位姿,用投影及点对点损失提升几何一致性,遮挡下旋转估计仍具竞争力。
小型语言模型网状网络中的通信强化学习
小型语言模型网状网络学习通信,置信度提示与修正、去中心化投票,提升推理准确率并抗合谋。
利用空间结构进行全切片图像的转导式小样本分类
提出SlideTIM,结合空间-潜层正则与类别先验,改进全切片图像转导式小样本分类,宏F1显著提升。
TRACKGRAPH:基于图像空间跟踪的在线开放词汇3D场景图
TRACKGRAPH在图像空间跟踪2D掩码后融合为3D,实现在线开放词汇场景图,比OVI-MAP快1.7倍、省3.3倍显存。
基于大语言模型与知识图谱引导推理的学生意义建构建模
中型LLM分析协作意义建构:推理提示与知识状态诊断可提升失败识别及专家一致性,但无单一最优配置。
FTB Graph:确定并验证多语言语言模型中的首词元广播器与语言身份头电路
通过EAP与激活修补分析六种多语言模型,揭示首词元语言身份电路,发现其预训练形成、指令微调保留,EAP需精确验证。
MoMHa:面向准确率、安全与Token的LLM外围框架多目标优化
提出MoMHa,用单阶段联合奖励搜索LLM外围框架,在17个领域同步优化准确率、安全与Token成本,效果超越所有基线。
面向基于深度强化学习的入侵检测系统的可解释概率鲁棒性驱动通用对抗扰动
提出概率鲁棒性驱动的通用对抗扰动,用可解释性约束生成PX-UAP攻击DRL入侵检测,优于现有方法。
我们需要回答那个问题吗?自然对话中潜在问题的显著性与可回答性
自然对话中,潜在问题显著性与可回答性稳健弱正相关但弱于独白,对话更难预测;结构化交流标注一致性更高。