61629 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CL

测试时扩展与训练在个体立场预测中何处失效?

研究测试时扩展与训练在个体立场预测的不足,发现四类失败模式,并提出结合直接评分与个人历史证据的方法。

04:00
arXiv cs.CV

基于核的 CLIP 引导:融入视觉语言模型偏好

提出核引导方法,将视觉语言模型偏好迁移至 CLIP,无需教师嵌入或人工标注,提升检索并保持识别能力。

04:00
ArXiv AI

超越双人记忆:面向多方口语对话的交互感知多模态记忆与自适应智能体检索

提出交互感知多模态记忆框架,融合说话人识别、分层记忆与智能体自适应检索,多方对话基准超基线23.6分。

04:00
arXiv cs.LG

HyperLabel:基于超图的标签相关性建模的多标签分类

提出HyperLabel,以超图显式建模高阶标签依赖,跨模态编解码,七基准最优,宏F1显著提升。

04:00
arXiv cs.LG

高斯LoRA的认证前沿:独立先验、后验风险与保持预测的平衡

高斯LoRA认证需低损失与低KL;保预测平衡降KL,Chernoff可认证,Hoeffding不能。

04:00
arXiv cs.CL

CAME:面向可解释提前一季度营收预测的公司感知证据记忆专家

提出CAME,用语义证据和误差记忆修正无泄漏统计锚,提升提前一季营收预测并可溯源解释。

04:00
arXiv cs.CV

面向无线边缘大规模场景重建的联邦3D高斯泼溅

提出资源高效的联邦3D高斯泼溅框架,结合设备端剪枝轻量化与模型恢复,在无线边缘实现大规模场景重建。

04:00
arXiv cs.CV

出现不等于忠实:文本到图像生成中的喻体入侵

文生图中存在喻体入侵:喻体被误绘为可见物且跨语言持续;提出诊断基准、评分与缓解法。

04:00
arXiv cs.LG

SIMANF:通过归一化流中的模拟退火实现非归一化分布的无样本学习

融合模拟退火与归一化流,仅用非归一化密度、无需目标样本,逐步退火精修,缓解模式崩塌,学习高维多峰分布

04:00
arXiv cs.CL

CoLMbo-SV:面向可解释说话人验证的声学接地语言模型

提出声学接地语言模型 CoLMbo-SV,兼顾高精度验证与可核查比较报告,EER 0.99%,错误降约80%。

04:00
arXiv cs.LG

预训练数据投毒的可解理论:机制依赖的标度指数

可解投毒理论:干净性能幂律退化,非整数标度指数源于奇异结构,且指数依赖极限顺序。

04:00
arXiv cs.LG

FUND:用于采样非归一化分布的密度流

提出无需真实样本训练的密度流算法,迭代重塑目标分布,高效精确采样玻尔兹曼分布。

04:00
arXiv cs.AI

MA-FPPO:多智能体流匹配预训练策略优化

提出MA-FPPO,在线微调流匹配预训练的多智能体策略并以团队优势更新,平均超最强离线基线52.8%。

04:00
arXiv cs.LG

协同何时有助于主动特征获取?一项基于PID的研究

提出SynAFA,用PID分析协同信息:低预算下有益,高预算消失,且局部信息难转化为有效获取目标。

04:00
ArXiv AI

视觉-语言-动作模型对单步观测扰动是否鲁棒?

研究VLA对单步观测扰动的鲁棒性,发现性能下降且受动作块长度影响,提出低开销CARE动态选择执行长度。

04:00
ArXiv AI

ProTTT:以测试时训练学会学习语义用户记忆

以用户画像监督学习共享初始化,测试时训练将用户历史压缩为持续演化的语义记忆,超越基线且降低成本。

04:00
arXiv cs.CV

RoboSTAR:面向人形机器人的下一尺度自回归手语翻译

RoboSTAR:文本驱动手语生成框架,以部位量化与下一尺度自回归由粗到细并行生成身体与手部动作,可重定向至人形机器人执行。

04:00
arXiv cs.CL

校准而非答案选择:蒸馏推理模型的内部置信度

内部置信度校准优于答案选择;Probe-SD自蒸馏微调显著降低ECE,改善加权投票。

04:00
arXiv cs.CL

图像旁的文本:面向可信多模态医疗数据及更广领域的检测、效用与泄露

评估多语种医疗报告文本去标识化下的检测、效用与残余泄露,跨文档关联仍可重识别。

04:00
ArXiv AI

CUE-Mem:基于多模态对话中隐式线索的长期用户记忆评测

提出CUE-Mem多模态基准,含2674道题,揭示隐式线索的保留与检索是长期用户记忆的主要瓶颈。

04:00
arXiv cs.AI

LLMAdBench:面向大语言模型回复中广告投放的人类偏好基准

LLMAdBench:含1.8万人类判断,评测大模型回复广告位置偏好;前沿模型评判不可靠,微调有效。

04:00
arXiv cs.LG

论硬提示的能力与局限

首次证明硬提示存在性NP完全、最优NP难;短/长硬提示有本质局限,线性硬提示无;给出泛化紧界与充要条件。

04:00
arXiv cs.LG

基于过渡正则化的扩散模型持续数据遗忘

提出基于过渡正则化的持续数据遗忘框架,用固定容量转移记忆约束更新,平衡删除持久性与生成效用。

04:00
arXiv cs.CL

从位置风险到块存活:扩散语言模型的更快生成

提出BRISK-DLM,以风险奖励加权与前缀条件校正器优化并行生成,吞吐量提升37.4%且质量不降。

04:00
arXiv cs.CL

面向扩散语言模型的犹豫感知在线策略蒸馏

犹豫感知在线策略蒸馏将教师匹配扩展至所有掩码位置并按后见加权,无需额外前向,多基准最优且加速解码。

04:00
arXiv cs.CV

FSS-UBrain:多区域小样本脑肿瘤MRI分割

提出区域式单样本脑肿瘤MRI分割框架,在BraTS上对WT、TC、ET取得高Dice和低HD95。

04:00
ArXiv AI

EMIR²:演化感知记忆与意图引导的多轮检索

提出EMIR²框架,以状态演化记忆图结合意图引导多轮检索,长期记忆与冲突处理性能相对提升逾12%。

04:00
arXiv cs.LG

刷新还是实现?漂移模型中的算力分配

墙钟匹配时,刷新漂移场比加深拟合FID更低;重绘支持方向变化远大于参数更新。

04:00
arXiv cs.CV

OpenMASC:用于加速MRI中跨轨迹金属感知采样与校正的开源流程

开源流程OpenMASC:生成配对金属伪影MRI数据,校正网络与强化学习联合优化采样,适配多轨迹。

04:00
ArXiv AI

人工智能与人类科学家在理论构建中展现互补优势

比较人机理论构建:多数任务AI个体表现更强、理论更复杂;人类理论更简洁多样、聚合增益更大,二者优势互补。

04:00
arXiv cs.CL

BaatCheet:面向印度语言对话翻译的多语言语料库

多语言对话翻译语料库含约4.9万对话、5个方向;微调开源大模型显著提升,自动、LLM与人工评估。

04:00
arXiv cs.AI

让失败发声:面向智能体数据分析的可审计运行时

RADAR是可审计运行时,通过证据保留、类型化操作和运行时校验让智能体显式报错,多项基准显著提升。

04:00
arXiv cs.CV

FoundDSR: A Generalizable Foundation Model with Guided 2D Gaussian Splatting for Depth Super-Resolution

04:00
arXiv cs.LG

超维计算的叠加推理

提出SupHDC叠加推理范式,共享编码多个查询,速度最高提升2.08倍,精度损失仅2.67个百分点。

04:00
arXiv cs.CL

CHI:统一实体、关系与数量维度的摘要评估复合幻觉指数

提出CHI统一幻觉指标,融合实体、关系、数量三维度,与人类判断相关性最高,可分解、可解释。

04:00
arXiv cs.AI

Porimon:一种基于长/短期知识增强生成提升的大语言模型宝可梦对战智能体

提出LSTKAG并构建宝可梦对战智能体Porimon,融合长短时知识检索与伤害API,显著超越基线。

04:00
arXiv cs.CV

基于重嵌入网络的两阶段多视角步态识别

提出TFTR两阶段框架:孪生网络提取视角嵌入,Transformer重嵌入灵活融合多视角,两数据集准确率领先。

04:00
ArXiv AI

可解释的物理信息引导WiFi室内定位:学习有效的接入点几何结构并据此剪枝

物理信息解码器仅凭RSSI与标注位置推断AP几何用于剪枝;误差降26%–36%,剪去半数AP精度仍佳。

04:00
arXiv cs.LG

并非所有误差都重要:决策相关预测误差可预测规划质量

提出决策相关预测误差(DRPE),仅衡量影响决策的状态维度误差;实验显示其与规划成功率强相关,而总预测误差仅弱相关。

04:00
arXiv cs.CL

学习预测世界有助于智能体行动吗?——世界模型后训练审计

错配观测使预测精度降15.3%-61.6%,任务收益仍存;随机奖励也提升表现,增益非源于世界预测。

04:00
arXiv cs.CL

语言辨别能力提升多语言语音模型的语言学习

多语言语音模型预训练中强化语言辨别,可缩小与单语模型的差距,且首轮引入效果最佳。

04:00
arXiv cs.LG

排行榜能证明什么?面向生物医学文献综述智能体公平评估与训练的组合可控性

提出组合可控性,构建BioLitBench,拒绝11/21不可比比较,并训练SCRIBE获认证排名。

04:00
arXiv cs.LG

相空间注意力:Hairer 提升绕开单层归纳障碍

将注意力提升至辛相空间,绕过单层归纳障碍;不增参数、缓存不变,开销极低,并观察到归纳能力涌现。

04:00
arXiv cs.CV

HeroFrame-Bench:基于评分标准–排序协同演化的参考锚定评测,用于电影主视觉帧选择

构建HeroFrame-Bench,以参考锚定百分位与评分标准–排序协同演化评测电影主视觉帧选择,人机一致率升至83.78%。

04:00
arXiv cs.CV

流动中的骨架:面向人体运动预测的图结构流匹配

提出图结构流匹配,以时空骨架图与条件速度场生成未来运动并保持骨骼约束,AMASS验证且跨骨架泛化。

04:00
arXiv cs.CL

CertMark:具有认证解码的无失真多比特水印

提出CertMark:用消息种子精确采样保持原分布,支持认证弃权解码,保持文本质量并可靠恢复多比特消息。

04:00
arXiv cs.CV

一次感知,全部机动:面向机动级信号意图预测的方向性交通信号理解

提出方向性交通信号理解任务,从前视图预测直行、左转、右转、掉头各信号的通行性,方向级建模更优。

04:00
arXiv cs.LG

不完整训练数据下的主动特征获取

研究训练数据不完整时的主动特征获取,比较三种学习范式,发现缺失主要损害多步获取,生成式恢复可挽回性能。

04:00
arXiv cs.CV

面向多模态大模型区域到全局迁移的渐进视图在线策略蒸馏

提出渐进视图在线策略蒸馏,以填充裁剪为过渡,将学生视图由局部迁移至全图并加权监督,多任务平均准确率达77.51%。

04:00
arXiv cs.CV

SGA-Flow-GRPO:面向Flow-GRPO的空间梯度引导信用分配

提出空间梯度引导的信用分配框架,用奖励梯度构建连续空间信用图,辅以MAD鲁棒归一化,在GenEval上达SOTA对齐质量。