62256 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.CV

EndoFSA:基于秩约束参数适配的内窥镜小样本图像生成

EndoFSA冻结预训练生成器,仅低秩更新少量参数以适配WCE小样本异常生成,合成图分类媲美真实图像。

04:00
arXiv cs.CV

OceanXL:基于分块划分与自适应剪枝的大规模水下3D高斯泼溅

OceanXL以分块划分与自适应剪枝实现可扩展的大规模水下3D高斯泼溅重建,兼顾高效与紧凑表示。

04:00
arXiv cs.CL

来自主动语音代理蜜罐的真实诈骗与骚扰电话对话语料库

主动语音蜜罐53天采集万通真实诈骗与骚扰通话,含895小时音频及逐轮转录,并验证真实性。

04:00
arXiv cs.LG

辅助学习的解析理论

基于师生框架推导在线SGD动力学方程,揭示辅助任务通过平衡优化驱动力与梯度噪声提升泛化能力。

04:00
arXiv cs.AI

NNV3:将神经网络验证拓展至新架构与新领域

NNV3发布:扩展星集支持新架构,新增概率可达性与公平性验证,覆盖图网络、视频等新领域基准。

04:00
arXiv cs.CV

并非所有混淆都一样:面向细粒度飞机检测的来源感知不确定性诊断

提出A²E²,将混淆按偶然/认知与类内/类间分解为四类可量化来源,用于细粒度飞机检测,并以针对性干预只减少可约混淆。

04:00
arXiv cs.LG

SwitchPFN:面向冻结式上下文时间序列分类的共享切换动力学

提出SwitchPFN,学习共享投影与码本,使时序动态特征跨样本可比,平均准确率相对提升4.47%。

04:00
arXiv cs.CL

CodeGraph:基于维基数据锚定的源代码开放分类法知识图谱

用代码大模型抽取语义实体并链接维基数据,构建含1.58亿节点、10亿边的源码开放分类知识图谱。

04:00
arXiv cs.AI

零数据自我博弈预训练

零数据自我博弈预训练:生成器与学习器协同搜索可计算结构,零样本损失随计算可预测扩展,并现上下文学习。

04:00
arXiv cs.LG

TopU-LBVS:面向基于配体虚拟筛选的真实多靶点基准

提出TopU-LBVS多靶点硬负样本基准,覆盖93靶标,揭示随机诱饵会高估LBVS性能。

04:00
arXiv cs.CL

口音类比引导:跨语言语音克隆中同等口音下更高的说话人相似度

提出免训练口音类比引导,减少参考口音泄漏,同等口音下提升说话人相似度,四个开源TTS模型有效。

04:00
arXiv cs.CL

将语言模型从视觉编码器中解放:语义序列化作为小语言模型的感知接口

冻结感知栈将场景序列化为文本供纯文本LLM作答,7B/3B超越同规模零样本VLM,监督下二者趋同。

04:00
arXiv cs.LG

MF-SCBO:多保真可扩展约束贝叶斯优化

提出MF-SCBO,将可扩展约束贝叶斯优化拓展至多保真,支持高维、黑箱约束与非嵌套采样,收敛更优。

04:00
ArXiv AI

PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露

PrivDrift基准:话题漂移后用户秘密仍可被探测恢复,千组对话泄露率38.7%–54.6%,属持续性行为失效。

04:00
arXiv cs.CV

基于姿态基础模型的运动攀岩免训练岩点使用检测

免训练,用冻结姿态基础模型指尖趾关键点检测攀岩岩点使用,F1达90.2%,优于基线。

04:00
arXiv cs.CV

AdaTex4D:面向4D高斯泼溅的自适应纹理容量分配

AdaTex4D为4D高斯泼溅按可见性梯度与形变尺度自适应分配纹理容量,纹理存储减半且质量保持,固定显存下更优并降低峰值内存。

04:00
ArXiv AI

HEXIS:将智能体技能编译为扩展有限状态机

将智能体技能编译为扩展有限状态机,分离知识与控制流,成功率平均提升16.1个百分点。

04:00
arXiv cs.CL

在自动语音识别中从未标注测试数据学习新词

提出ASR测试时从未标注数据学新词,以KL散度优化CTC候选拼写,OOV字符错误率最多降14.97%。

04:00
arXiv cs.CV

GHOST-Q:研究量化视觉语言模型中同分取舍下被忽视的视觉接地幻觉

量化视觉语言模型即使保持总分,仍会显著改变视觉接地成败,且省内存未必降延迟,需联合评估。

04:00
arXiv cs.LG

从图到馈线:约束引导的规则合规馈线生成

提出PG-DiGress,以约束引导扩散生成合规馈线,严格通过率从13.7%升至96.8%。

04:00
arXiv cs.LG

面向多年AADT估计的图上时空互补特征传播

提出时空互补特征传播框架,融合稀疏传感器与宏观交通模型,实现全网多年AADT估计,误差低于10%。

04:00
ArXiv AI

SciWalker:基于算子图与执行反馈合成科学编程问题

通过算子图采样与执行反馈合成科学编程题,构建8178题,经强化学习使SciCode子问题准确率提升9.9个百分点。

04:00
arXiv cs.CL

奖励倾斜的在线策略蒸馏:面向音频语言模型的声学依据

提出RT-OPD:用教师有无音频的对数概率差为奖励重塑分布,做反向KL蒸馏强化声学依据。

04:00
arXiv cs.CL

面向通用服务机器人的基于大模型链式任务规划的设计与评估

提出LLM链式两阶段架构,提示长度减约45%,各模型规划提升最高37个百分点,实机10任务完成6项。

04:00
arXiv cs.AI

服务前先筛选:面向1.4亿规模生产级客户体验AI智能体的仿真

用假设驱动仿真在部署前筛选CX智能体,仿真与生产评分高度相关,助力tNPS和自助率显著提升。

04:00
arXiv cs.CV

超越空间基准:从空间推理到导航

空间推理基准难直接提升导航;提出两阶段微调与空间先验蒸馏,8B模型低训耗超越多系统。

04:00
arXiv cs.CV

AERIAL:精度保持的低精度脑电解码器鲁棒性的对抗评估

BCI实验中,精度保持压缩不提升脑电解码器直接鲁棒性,但剪枝显著降低对抗迁移效率,三者相互独立。

04:00
arXiv cs.LG

当时间扰动类似传感器偏置:可穿戴活动识别器的无标签审计

无标签审计可穿戴 HAR:重放相位随机扰动,27 个模型准确率降 2.87–40.83 点,直流扰动破坏更大。

04:00
arXiv cs.LG

利用测试时增强提升黑盒放射学AI的校准

DualTTA:模型无关测试时增强框架,改善黑盒放射AI校准,肺栓塞与颅内出血误差降54%和43%。

04:00
arXiv cs.CL

个性化韩语唇读作为视觉语音识别:OLKAVS 上的迁移、统计与自适应

提出个性化韩语VSR系统,在OLKAVS上量化个体误差;低秩适配器以少量视频降低高错说话人CER并跨摄像头迁移。

04:00
arXiv cs.LG

残差相关性作为GP共区域化联合不确定性增益的诊断指标

共区域化主要提升联合不确定性而非点预测;残差相关性可预测该增益,据此提出诊断量与残差ICM方法。

04:00
arXiv cs.AI

GRASP:面向战略规划的智能体AI生成、修订与评估

GRASP是策略感知的多阶段规划框架,通过生成、修订、评估模块化协作,大幅提升复杂任务规划准确率并消除多任务性能退化。

04:00
arXiv cs.LG

皮层-小脑环路中误差与预测驱动的运动学习

提出小脑启发框架,融合多路预测与内部反馈,编码运动学与误差信号,实现延迟下在线校正并使适应提速十倍。

04:00
arXiv cs.CV

Ego-Exo4D 人体网格数据集:面向自我—他人视角采集的4D人体运动重建

Ego-Exo4D仅有稀疏3D姿态,本文提出大规模4D人体运动重建数据集Ego-Exo4D-HM及配套重建流程。

04:00
arXiv cs.AI

面向Roblox游戏搜索中多组件查询理解的搜索感知强化学习

提出蒸馏后强化学习框架,按组件用搜索实时反馈奖励优化查询理解,NDCG@20较SFT提升8.9。

04:00
arXiv cs.CV

基于免训练轨迹路由的视频扩散加速

TRACK通过校准比较大小模型的预测差异,将低差异步骤路由至小模型,无需训练即可加速视频扩散推理,最高提速2.7倍。

04:00
arXiv cs.CV

OmniFabric:面向三维服装重建的连贯UV空间纹理合成

OmniFabric在缝纫图案空间合成全局连贯纹理,用扩散Transformer在UV域精炼去伪影,生成可重光照的逼真3D服装。

04:00
arXiv cs.LG

追踪状态还是追踪陪集?学习到的状态追踪的代数解释

模型学群元素乘积时追踪陪集而非精确状态;部分精度由陪集大小决定,子群陪集结构揭示学习阶段与内部计算。

04:00
arXiv cs.LG

超越平均安全:机会约束的大语言模型微调

提出机会约束微调框架,限制安全样本退化比例,采用可微违规率替代与约束感知梯度下降,实验验证优于基线。

04:00
arXiv cs.AI

Jev-Mobile:以Jev作为移动GUI智能体的执行器

Jev-Mobile让VLM低频规划、Jev高频执行GUI动作,成功率79%,成本降73.4%。

04:00
arXiv cs.CL

ExplorationBench:衡量AI系统在可验证异世界中的探索能力

发布ExplorationBench基准:以规则可执行、与常识相悖的可验证异世界沙盒,评测AI能否通过探索获取并应用全新知识。

04:00
arXiv cs.CL

用可渲染程序进行多模态思维

SVGLM用SVG基元连接文本与图像推理,构建SVG图像编辑数据集,使VLM能"边想边画"。

04:00
arXiv cs.CV

WanPE:面向现代文本到视频生成的电影级提示增强

WanPE以397B参数、105万视频训练,实现电影级镜头规划,30秒视频人类偏好提升50.86分。

04:00
ArXiv AI

SAGE:通过拓扑引导缓解长时程推理偏差

SAGE以代数稀疏化和双曲结构引导缓解长时程推理偏差,多基准领先,Andrews-Curtis任务提升达8倍。

04:00
arXiv cs.CL

在扩散语言模型中实现近似联合采样

提出轻量采样器,使扩散语言模型单次全模型前向可近似联合采样多个词元,兼顾并行与精度,MAUVE达0.87。

04:00
arXiv cs.AI

人工智能在科学中的应用:早期洞察

多源数据显示:科学家广泛使用AI,其与专业模型互补,每周省约7小时,但瓶颈下移、验证需求激增。

04:00
ArXiv AI

电子健康记录信息检索的动态基准

提出可自动生成EHR问答的可持续基准BRIE,经19名临床医生验证,揭示LLM常遗漏关键临床信息。

04:00
arXiv cs.CV

TrackEverything:通过去重三维场景表示实现长时程稠密跟踪

提出TrackEverything,将视频表示为持久三维场景轨迹并去重,实现超千帧全点稠密三维跟踪,性能领先。

04:00
arXiv cs.LG

让训练引导选择:基于真实锚定效用的在线合成数据过滤

FROST以真实数据梯度反馈衡量合成数据效用,在线过滤约两至三成合成样本,在图像分类、文本转SQL与工业广告重排中均显著提升真实任务性能。

04:00
arXiv cs.CV

多模态大语言模型中的对齐幻觉

逐层视觉-文本相似度并非内容级对齐;受控干预揭示标量指标可被权重诱导,提出主角度间隙诊断,需任务证据校准。