62316 条条目 · 106 个活跃源
2026年9月24日
04:00
arXiv cs.LG

fMRI 基础模型的规模缩放研究

万级GPU时实验显示,fMRI基础模型缩放需协同数据、模型与训练时长,算力本身不足以决定性能。

04:00
arXiv cs.CV

生成式视频压缩的信息容量:量化同等质量下的码率—算力交换

提出信息容量指标,量化等质量下码率与解码算力的交换,14B解码器效率约是1.3B的十倍。

04:00
arXiv cs.CV

混合高斯表示:面向鲁棒开放词汇3D分割的多视角物体关联与边界细化

提出混合高斯统一3D表示,联合多视角物体关联与语义对比学习,并优化边界重建,LERF上mIoU达59.1%。

04:00
arXiv cs.LG

面向稀缺数据的谱连通性先验图学习

提出SCoGL,以拉普拉斯谱连通先验增强GLASSO,在稀缺数据下改进图恢复与图信号去噪。

04:00
arXiv cs.CL

注意力路由早期即趋稳定:面向循环语言模型的工作集推理

注意力路由在循环深度中早期稳定;WISE前期全局注意力、后期复用稀疏工作集,基本保持质量并提速。

04:00
arXiv cs.CL

规划式测试时扩展与协同推理路径

提出PTTS,以规划器生成大纲引导分支走向不同推理路径,替代独立采样,显著提升数学推理性能。

04:00
arXiv cs.CV

空间不可见,时间可见:面向GUI智能体的运动视觉CAPTCHA

运动视觉CAPTCHA靠时序分离隐藏语义;600例基准中人类99.6%,最佳GUI智能体16.8%。

04:00
arXiv cs.LG

发现、证伪、修正:审计智能体发现细胞模型中从源代码到预测贡献的输入使用主张

提出CELLAUDIT审计输入使用:高预测性能未必依赖扰动,证伪修正可恢复贡献。

04:00
arXiv cs.CL

面向越南劳动法的跨语言法律问答:检索、翻译与验证器引导的纠正

构建越南劳动法双语问答评测集,发现密集检索优于稀疏与混合,验证器引导纠正仅提升引用保真度。

04:00
arXiv cs.LG

面向在线自适应的贝叶斯神经网络全协方差平滑

提出全协方差贝叶斯神经网络平滑法,突破对角协方差限制,实现在线自适应且更准确。

04:00
arXiv cs.CL

沉默与重叠皆非失败:全双工语音对话模型中话轮转换的意图条件化评估

提出TACT基准,按说话人意图评估全双工话轮转换,与人类判断相关性0.81,优于二值指标。

04:00
arXiv cs.CV

CereVLA:受小脑启发、后果感知的残差治理,实现高效视觉-语言-动作执行

提出受小脑启发的CereVLA,用流残差修正并预测后果,抑制不利校正,提升VLA执行成功率与效率。

04:00
arXiv cs.LG

将预训练大语言模型改造为高保真连续文本自编码器

提出LLMAE,借预训练LLM内部激活构建定长连续潜瓶颈,实现近完美文本重建,并可支撑潜空间扩散图像描述。

04:00
arXiv cs.CL

MORSE:基于逆向评分的多上下文排序,实现证据保留压缩

提出MORSE方法,通过逆向评分调整上下文顺序,缓解信息抢占,提升证据保留与多跳问答效果。

04:00
arXiv cs.CV

SatUnreal:基于虚幻引擎的卫星立体匹配高精度合成数据集

提出基于虚幻引擎的高精度卫星立体匹配数据集SatUnreal,含1万立体像对,零样本迁移超越真实数据。

04:00
arXiv cs.CV

无语义先验的重叠视觉分组

提出DPG无需语义先验,多测量域交叉重叠生成非排他性视觉分组,BSDS500验证其与人标注区域边界对应。

04:00
arXiv cs.CL

基于混合RAG与本地部署大语言模型的处理活动记录(RoPA)自动提取

为越南RoPA合规,提出混合RAG与本地LLM自动提取系统及基准,端到端覆盖过半,本地模型与云端相当。

04:00
arXiv cs.LG

NGN:将神经网络规模作为可微计数来学习

NGN用可微边界为每组有序组件选激活前缀,边界随训练增长、部署时截断,将结构容量作为计数直接优化。

04:00
arXiv cs.CL

一个适配模型能否包揽一切?客服大语言模型的微调策略选择

基于13个模型、8个客服数据集训练超200个检查点发现:多任务全量微调是各规模下最稳健的默认方案,专家模型跨任务易失效,LoRA顺序微调与模型合并可缓解。

04:00
arXiv cs.CV

潜在演化的世界动作模型

提出LeWAM,以JEPA嵌入替代视频扩散进行动作生成与环境演化,并用DemoDPO离线偏好优化,RoboTwin成功率92.28%。

04:00
arXiv cs.LG

柏拉图表征假说中什么在收敛?结构胜于几何

校准后,关系结构在局部与全局均稳健收敛;度量几何收敛明显更弱,并在黎曼度量与视频文本中复现。

04:00
arXiv cs.LG

直播助手:学习在真实世界直播社交流中是否、何时以及向谁提供协助

提出直播助手,将是否、何时、对谁、说什么建模为决策;可选沉默、记忆或回应,建基准训练,效果领先。

04:00
arXiv cs.CL

Ruby-ASR:面向正字法与词汇读音联合识别的证据保留式监督

Ruby-ASR将日语ASR目标细化为书写片段与词汇读音绑定序列,提升读音恢复且不损正字法转写。

04:00
ArXiv AI

MAVP:面向移动操作的地图感知视觉运动策略

MAVP通过预测基座位姿目标并借助定位反馈跟踪,提升移动操作成功率,六项真实任务均优于速度控制。

04:00
arXiv cs.AI

节奏未尽如人意:面向唇形同步配音的语音活动感知语音合成

以二值语音活动信号为条件合成语音,实现精准唇形同步配音;训练时随机遮蔽使该条件可选,兼顾自然韵律与句中停顿。

04:00
arXiv cs.CV

DeltaS:读取门控线性注意力状态以实现流式视频中的 KV 缓存驱逐

DeltaS免训练且与查询无关,以门控线性注意力状态漂移选取信息量大的视频块并驱逐KV缓存,优于基线。

04:00
arXiv cs.AI

TriWorldBench:具身世界模型的三视角一致性视角

提出TRIWORLDBENCH基准,用同步头与双手腕视频及19项指标,评估具身世界模型的跨视角一致性与任务对齐。

04:00
ArXiv AI

基于空域-频域-光流多模态特征融合的AIGC视频检测

提出CrossAtt-VFD,双分支融合空域-频域与光流特征,经跨注意力对齐检测外观与运动不一致,准确率达94.22%。

04:00
arXiv cs.LG

SR-Fraud:面向非平稳支付欺诈检测的结果监督反思式LLM智能体框架

SR-Fraud以结果监督反思LLM解耦实时决策与离线适应,在支付欺诈基准提升检测并识别突发欺诈。

04:00
arXiv cs.CL

引发行动的引导:多模态网页智能体中引导与行动互增强的离线研究

提出WebMRE离线基准,证实引导与行动互增强,引导是因果指令通道,微调模型超GPT-5.5等。

04:00
arXiv cs.AI

移动出行中大型语言模型的安全与隐私

综述移动出行LLM应用,指出研究偏重交通与性能,忽视安全隐私及AI法案合规,亟需安全设计。

04:00
arXiv cs.AI

QuantWM:面向世界模型与视频生成的时序一致2比特KV缓存量化

免训练2比特KV缓存量化,保持注意力并提升世界模型与视频生成画质和时序一致性,压缩达6.2倍。

04:00
arXiv cs.LG

KITE:面向高效智能体 LLM 规模化的 KV 不变 Transformer 扩展

KITE 新增参数不影响注意力 KV,小模型扩为大模型,省训练与推理成本;SST 优于基线并降本。

04:00
arXiv cs.AI

PP-Net:面向嵌入式设备生物医学图像散射光去除的混合物理先验神经网络

提出融合物理先验的PP-Net,去除生物医学图像散射光,显著提升PSNR/SSIM,并可在嵌入式设备部署。

04:00
arXiv cs.AI

GitScholar:基于GitHub参与度预测AI研究影响力的数据集

GitScholar:GitHub互动可提升AI论文影响力早期预测精度达12%,并近乎覆盖高影响力论文。

04:00
arXiv cs.AI

影像组学与基础表征在肾细胞癌分类中的互补作用:2D与3D CT编码的比较研究

比较影像组学、2D/3D MedVAE及其融合用于肾癌分型;3D门控融合AUC达82.7%,表明二者互补。

04:00
arXiv cs.AI

FeatLens:面向仓库级代码生成的特征引导动态代码图构建与检索

FeatLens用特征索引动态构建任务代码图并检索依赖,降低开销并提升仓库级代码生成效果。

04:00
arXiv cs.CL

PRISM-VLM:面向紧凑型视觉语言模型的多轴判别性基准

提出多轴基准PRISM-VLM,沿七轴评分紧凑视觉语言模型并合成PScore,比单轴基准更可靠区分模型,揭示谄媚等行为差异。

04:00
arXiv cs.CL

路径至关重要:在知识图谱问答中超越答案准确率评估小语言模型

小模型在知识图谱问答中导航能力差异大,答案准确率与路径保真度有时偏好不同模型,需超越终点准确率评估。

04:00
arXiv cs.CL

当并行草稿模型遇上并行投机解码

提出DPara并行投机解码框架,复用并行草稿器,使扩散骨干预计算与验证重叠且无需猜测回退,在Qwen3-8B/14B上平均加速3.21×和3.52×。

04:00
arXiv cs.CL

不可作弊评测:基于动态压缩的语言模型评估

动态收集新文本,以压缩率评测基座模型以规避数据污染;压缩率随模型规模呈一致缩放趋势,并与MMLU准确率强相关。

04:00
arXiv cs.LG

生物多样性监测中的主动学习:从标签效率到可靠的生态推断

综述生物多样性监测中的主动学习研究,指出现有评估忽视验证标签需求,提出兼顾训练与可靠生态推断的路线图。

04:00
arXiv cs.CV

CasCVS-Net:面向关键安全视野评估的分阶段多任务级联网络

分阶段多任务级联CasCVS-Net,以预测框与掩码联动检测、分割与CVS评估,改善罕见解剖定位。

04:00
arXiv cs.CL

EviStreams:面向医学系统综述的人在回路AI数据提取

EviStreams:人在回路AI平台,用于医学系统综述数据提取,含字段规范与盲法双审;字段规范比模型选择更关键。

04:00
arXiv cs.LG

基于AUC界的无异常自优化

以AUC界为可微、无异常目标,直接优化异常检测系统连续参数,显著优于传统模型选择且对伪异常构造不敏感。

04:00
arXiv cs.CV

Know-Your-Scene(KYS)-SLAM:用于双目视觉SLAM特征匹配的层次化语义-运动先验

以层次化语义-运动先验调制特征匹配、取代硬剔除,在KITTI与EuRoC上显著降低轨迹漂移。

04:00
arXiv cs.LG

从保留-遗忘损失景观交互视角看量化鲁棒的遗忘

基于保留-遗忘损失景观分析,提出敏感度引导噪声正则化与遗忘关键层优化,提升量化下的遗忘鲁棒性并保持效用。

04:00
arXiv cs.LG

基于演化变分自回归网络的离散扩散模型

提出以演化变分自回归网络参数化归一化分布的离散扩散模型,扩展至高维伊辛系统并精确计算热力学量。

04:00
arXiv cs.CL

ThaiTrees:跨领域泰语句法依存树

泰语跨领域依存树库,含3.42亿词元,覆盖新闻、维基、口语与社交媒体,附频率词典及CoNLL-U解析数据。

04:00
arXiv cs.LG

预测工作流基准:评估语言模型在预算受限预测工具下的决策

FWBench以1251个电力与单车调度案例,评估语言模型在预算约束下选择预测并决策的能力。