fMRI 基础模型的规模缩放研究
万级GPU时实验显示,fMRI基础模型缩放需协同数据、模型与训练时长,算力本身不足以决定性能。
生成式视频压缩的信息容量:量化同等质量下的码率—算力交换
提出信息容量指标,量化等质量下码率与解码算力的交换,14B解码器效率约是1.3B的十倍。
混合高斯表示:面向鲁棒开放词汇3D分割的多视角物体关联与边界细化
提出混合高斯统一3D表示,联合多视角物体关联与语义对比学习,并优化边界重建,LERF上mIoU达59.1%。
面向稀缺数据的谱连通性先验图学习
提出SCoGL,以拉普拉斯谱连通先验增强GLASSO,在稀缺数据下改进图恢复与图信号去噪。
注意力路由早期即趋稳定:面向循环语言模型的工作集推理
注意力路由在循环深度中早期稳定;WISE前期全局注意力、后期复用稀疏工作集,基本保持质量并提速。
规划式测试时扩展与协同推理路径
提出PTTS,以规划器生成大纲引导分支走向不同推理路径,替代独立采样,显著提升数学推理性能。
空间不可见,时间可见:面向GUI智能体的运动视觉CAPTCHA
运动视觉CAPTCHA靠时序分离隐藏语义;600例基准中人类99.6%,最佳GUI智能体16.8%。
发现、证伪、修正:审计智能体发现细胞模型中从源代码到预测贡献的输入使用主张
提出CELLAUDIT审计输入使用:高预测性能未必依赖扰动,证伪修正可恢复贡献。
面向越南劳动法的跨语言法律问答:检索、翻译与验证器引导的纠正
构建越南劳动法双语问答评测集,发现密集检索优于稀疏与混合,验证器引导纠正仅提升引用保真度。
面向在线自适应的贝叶斯神经网络全协方差平滑
提出全协方差贝叶斯神经网络平滑法,突破对角协方差限制,实现在线自适应且更准确。
沉默与重叠皆非失败:全双工语音对话模型中话轮转换的意图条件化评估
提出TACT基准,按说话人意图评估全双工话轮转换,与人类判断相关性0.81,优于二值指标。
CereVLA:受小脑启发、后果感知的残差治理,实现高效视觉-语言-动作执行
提出受小脑启发的CereVLA,用流残差修正并预测后果,抑制不利校正,提升VLA执行成功率与效率。
将预训练大语言模型改造为高保真连续文本自编码器
提出LLMAE,借预训练LLM内部激活构建定长连续潜瓶颈,实现近完美文本重建,并可支撑潜空间扩散图像描述。
MORSE:基于逆向评分的多上下文排序,实现证据保留压缩
提出MORSE方法,通过逆向评分调整上下文顺序,缓解信息抢占,提升证据保留与多跳问答效果。
SatUnreal:基于虚幻引擎的卫星立体匹配高精度合成数据集
提出基于虚幻引擎的高精度卫星立体匹配数据集SatUnreal,含1万立体像对,零样本迁移超越真实数据。
无语义先验的重叠视觉分组
提出DPG无需语义先验,多测量域交叉重叠生成非排他性视觉分组,BSDS500验证其与人标注区域边界对应。
基于混合RAG与本地部署大语言模型的处理活动记录(RoPA)自动提取
为越南RoPA合规,提出混合RAG与本地LLM自动提取系统及基准,端到端覆盖过半,本地模型与云端相当。
NGN:将神经网络规模作为可微计数来学习
NGN用可微边界为每组有序组件选激活前缀,边界随训练增长、部署时截断,将结构容量作为计数直接优化。
一个适配模型能否包揽一切?客服大语言模型的微调策略选择
基于13个模型、8个客服数据集训练超200个检查点发现:多任务全量微调是各规模下最稳健的默认方案,专家模型跨任务易失效,LoRA顺序微调与模型合并可缓解。
潜在演化的世界动作模型
提出LeWAM,以JEPA嵌入替代视频扩散进行动作生成与环境演化,并用DemoDPO离线偏好优化,RoboTwin成功率92.28%。
柏拉图表征假说中什么在收敛?结构胜于几何
校准后,关系结构在局部与全局均稳健收敛;度量几何收敛明显更弱,并在黎曼度量与视频文本中复现。
直播助手:学习在真实世界直播社交流中是否、何时以及向谁提供协助
提出直播助手,将是否、何时、对谁、说什么建模为决策;可选沉默、记忆或回应,建基准训练,效果领先。
Ruby-ASR:面向正字法与词汇读音联合识别的证据保留式监督
Ruby-ASR将日语ASR目标细化为书写片段与词汇读音绑定序列,提升读音恢复且不损正字法转写。
MAVP:面向移动操作的地图感知视觉运动策略
MAVP通过预测基座位姿目标并借助定位反馈跟踪,提升移动操作成功率,六项真实任务均优于速度控制。
节奏未尽如人意:面向唇形同步配音的语音活动感知语音合成
以二值语音活动信号为条件合成语音,实现精准唇形同步配音;训练时随机遮蔽使该条件可选,兼顾自然韵律与句中停顿。
DeltaS:读取门控线性注意力状态以实现流式视频中的 KV 缓存驱逐
DeltaS免训练且与查询无关,以门控线性注意力状态漂移选取信息量大的视频块并驱逐KV缓存,优于基线。
TriWorldBench:具身世界模型的三视角一致性视角
提出TRIWORLDBENCH基准,用同步头与双手腕视频及19项指标,评估具身世界模型的跨视角一致性与任务对齐。
基于空域-频域-光流多模态特征融合的AIGC视频检测
提出CrossAtt-VFD,双分支融合空域-频域与光流特征,经跨注意力对齐检测外观与运动不一致,准确率达94.22%。
SR-Fraud:面向非平稳支付欺诈检测的结果监督反思式LLM智能体框架
SR-Fraud以结果监督反思LLM解耦实时决策与离线适应,在支付欺诈基准提升检测并识别突发欺诈。
引发行动的引导:多模态网页智能体中引导与行动互增强的离线研究
提出WebMRE离线基准,证实引导与行动互增强,引导是因果指令通道,微调模型超GPT-5.5等。
移动出行中大型语言模型的安全与隐私
综述移动出行LLM应用,指出研究偏重交通与性能,忽视安全隐私及AI法案合规,亟需安全设计。
QuantWM:面向世界模型与视频生成的时序一致2比特KV缓存量化
免训练2比特KV缓存量化,保持注意力并提升世界模型与视频生成画质和时序一致性,压缩达6.2倍。
KITE:面向高效智能体 LLM 规模化的 KV 不变 Transformer 扩展
KITE 新增参数不影响注意力 KV,小模型扩为大模型,省训练与推理成本;SST 优于基线并降本。
PP-Net:面向嵌入式设备生物医学图像散射光去除的混合物理先验神经网络
提出融合物理先验的PP-Net,去除生物医学图像散射光,显著提升PSNR/SSIM,并可在嵌入式设备部署。
GitScholar:基于GitHub参与度预测AI研究影响力的数据集
GitScholar:GitHub互动可提升AI论文影响力早期预测精度达12%,并近乎覆盖高影响力论文。
影像组学与基础表征在肾细胞癌分类中的互补作用:2D与3D CT编码的比较研究
比较影像组学、2D/3D MedVAE及其融合用于肾癌分型;3D门控融合AUC达82.7%,表明二者互补。
FeatLens:面向仓库级代码生成的特征引导动态代码图构建与检索
FeatLens用特征索引动态构建任务代码图并检索依赖,降低开销并提升仓库级代码生成效果。
PRISM-VLM:面向紧凑型视觉语言模型的多轴判别性基准
提出多轴基准PRISM-VLM,沿七轴评分紧凑视觉语言模型并合成PScore,比单轴基准更可靠区分模型,揭示谄媚等行为差异。
路径至关重要:在知识图谱问答中超越答案准确率评估小语言模型
小模型在知识图谱问答中导航能力差异大,答案准确率与路径保真度有时偏好不同模型,需超越终点准确率评估。
当并行草稿模型遇上并行投机解码
提出DPara并行投机解码框架,复用并行草稿器,使扩散骨干预计算与验证重叠且无需猜测回退,在Qwen3-8B/14B上平均加速3.21×和3.52×。
不可作弊评测:基于动态压缩的语言模型评估
动态收集新文本,以压缩率评测基座模型以规避数据污染;压缩率随模型规模呈一致缩放趋势,并与MMLU准确率强相关。
生物多样性监测中的主动学习:从标签效率到可靠的生态推断
综述生物多样性监测中的主动学习研究,指出现有评估忽视验证标签需求,提出兼顾训练与可靠生态推断的路线图。
CasCVS-Net:面向关键安全视野评估的分阶段多任务级联网络
分阶段多任务级联CasCVS-Net,以预测框与掩码联动检测、分割与CVS评估,改善罕见解剖定位。
EviStreams:面向医学系统综述的人在回路AI数据提取
EviStreams:人在回路AI平台,用于医学系统综述数据提取,含字段规范与盲法双审;字段规范比模型选择更关键。
基于AUC界的无异常自优化
以AUC界为可微、无异常目标,直接优化异常检测系统连续参数,显著优于传统模型选择且对伪异常构造不敏感。
Know-Your-Scene(KYS)-SLAM:用于双目视觉SLAM特征匹配的层次化语义-运动先验
以层次化语义-运动先验调制特征匹配、取代硬剔除,在KITTI与EuRoC上显著降低轨迹漂移。
从保留-遗忘损失景观交互视角看量化鲁棒的遗忘
基于保留-遗忘损失景观分析,提出敏感度引导噪声正则化与遗忘关键层优化,提升量化下的遗忘鲁棒性并保持效用。
基于演化变分自回归网络的离散扩散模型
提出以演化变分自回归网络参数化归一化分布的离散扩散模型,扩展至高维伊辛系统并精确计算热力学量。
ThaiTrees:跨领域泰语句法依存树
泰语跨领域依存树库,含3.42亿词元,覆盖新闻、维基、口语与社交媒体,附频率词典及CoNLL-U解析数据。
预测工作流基准:评估语言模型在预算受限预测工具下的决策
FWBench以1251个电力与单车调度案例,评估语言模型在预算约束下选择预测并决策的能力。