59223 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.AI

当更多数据还不够:生成式AI个性化中的上下文充分性前沿

提出上下文充分性理论:相关上下文比数量更重要,分不足、充分、饱和、干扰四态;实验表明无关上下文反降效果。

04:00
arXiv cs.AI

面向规范引导决策的简单信念道义逻辑

提出简单信念道义逻辑,定义规范遵从优化问题,区分主客观优化并给出归约至加权部分MaxSAT的条件。

04:00
arXiv cs.CL

以风格推理:发现并控制语言模型中的风格

无监督发现语言模型输出中六种风格,显式条件微调可控制风格并提升数学推理。

04:00
arXiv cs.CV

FedMAD:面向遥感图像分类的联邦学习调制感知定向聚合

提出FedMAD个性化联邦学习框架,分离全局与客户端参数,并设计调制感知定向聚合,抑制异构数据下的冲突更新。

04:00
arXiv cs.CV

《Soundwich:分层可控音频的视频生成》

Soundwich将冻结的音视频生成模型改造为生成多条与视频同步、可独立编辑的音频分轨的免训练框架。

04:00
arXiv cs.LG

面向自动化决策门控:System One 决策模型与训练分类器及语言模型的基准对比

在匹配条件下,基准测试 System One 决策模型、分类器与语言模型用于自动决策门控,优劣取决于标签、任务与风险条件。

04:00
arXiv cs.CV

基于推理与反思的个性化图像生成

提出首个基于用户历史的个性化图像生成基准,含场景与创意两任务,并推出推理-反思循环方法PEARL,指标平均提升15%。

04:00
arXiv cs.AI

基于本体、经推理器验证的科学AI大模型推理评测基准

提出从OWL本体自动生成多选题基准,推理器验证干扰项,六模型准确率41-77%,可诊断推理失败。

04:00
arXiv cs.CL

大型语言模型中的言语化概率与内部概率相互耦合

大模型内部与言语化概率均受训练数据分布和断言不确定性影响且相互耦合,言语化概率可探测内部分布。

04:00
arXiv cs.LG

M²Weather:联合多站点与多变量天气预报基准

提出M²Weather基准,覆盖三级2809站点5个耦合变量,统一协议与即插即用适配器,证明联合建模站点-变量关系可提升预报精度。

04:00
arXiv cs.CL

压缩语言模型中散度如何转化为决策翻转

总变差而非KL可直接预测压缩模型决策翻转率,中位比值1.05,并能预测投机解码接受率。

04:00
arXiv cs.LG

面向高效生成模型对齐的流形约束初始噪声优化

提出ZeNOVA:流形约束超球Langevin、退火软值引导与MH跳变无梯度优化初始噪声对齐黑箱奖励。

04:00
arXiv cs.LG

面向MDP中稀疏策略部署的贝尔曼认证舍入

有限MDP中连续策略稀疏二值舍入:2d+2次贝尔曼求解构建包络,候选界与局部积分提升认证、收紧损失界

04:00
arXiv cs.LG

注意力头消融何时能支持因果主张?投影级混杂、地板效应与匹配对照

单头消融易受投影位置、地板效应与对照不当影响;需连续指标和匹配对照,修正排名才稳定,但因果结论仍须审慎。

04:00
arXiv cs.AI

R-GroundBench:面向Markush分子编辑中R基团定位的诊断性基准

提出基于真实专利Markush结构的R-GroundBench基准,揭示模型在R基团定位与编辑上存在显著能力差距。

04:00
arXiv cs.CV

手语机器翻译

综述手语机器翻译进展与挑战:数据集与评测不足,需捕捉三维同步结构,强调伦理及与聋人社群协作。

04:00
ArXiv AI

ReLiveGym:在数周重放现实环境中评估长期运行智能体

提出ReLiveGym,用重放数周现实数据评估长期智能体,发现行动时机与反馈机制是设计关键。

04:00
arXiv cs.LG

FAER:面向语言模型后训练的可审计效用对齐轨迹回放

FAER提出可审计全轨迹回放框架,以学习者感知选择器对齐下游效用,在GSM8K上显著提升质量。

04:00
arXiv cs.AI

MemFit:高效的长期智能体记忆

MemFit 用免LLM的追加式存储与多路径检索,降低记忆构建成本与延迟,在三大基准达最优性能。

04:00
arXiv cs.CV

VTV-FM:通过变分终端速度闭合的流匹配

提出二阶流匹配框架VTV-FM,以最小化加速度能量推导缺失的终端速度,实现闭式闭合,提升传输几何与生成质量。

04:00
arXiv cs.AI

Sapien:面向自主 AI 智能体的有状态策略引擎

Sapien 是有状态策略引擎,用扩展正则约束工具调用序列,效用近无损,可拦截 93-95% 的攻击。

04:00
arXiv cs.CL

语境轨迹与增量语境位移:迈向利用大语言模型理解动态的、特定话语的意义建构

逐词重算上下文化词嵌入构建增量轨迹,能有效区分花园路径句与消歧句,话语信息分布于多表征尺度。

04:00
ArXiv AI

企业表示简化(ERS):降低企业AI的表示复杂度

提出企业表示复杂度(ERC)四维模型及经济成本模型,简化任务级表示可降低AI理解负担、提升推理准确率。

04:00
arXiv cs.LG

STCFormer:面向站点天气预测的动态聚类Transformer自适应时空建模

提出STCFormer,按时间片动态聚类站点,融合簇内局部与全局注意力,在八项天气预测任务中领先。

04:00
ArXiv AI

偏好不确定性下的鲁棒纳什对齐

提出鲁棒纳什对齐,用四玩家代理博弈与乐观镜像下降算法应对偏好不确定性,具收敛保证并提升表现。

04:00
arXiv cs.CL

魔鬼藏在重建损失尺度中:重新思考大语言模型量化中的优化

揭示LLM的PTQ中MSE重建损失尺度致优化失衡,RMSE变体隐式梯度归一化显著优于MSE。

04:00
arXiv cs.CV

视频生成模型:后训练与对齐综述

首篇视频生成后训练与对齐综述,提出隐式/显式对齐框架,归纳四类方法、数据基准及开放挑战。

04:00
arXiv cs.CV

视频证据索引:从视频预览中学习该看哪里,面向 Token 预算受限的长视频问答

提出视频证据索引,用低分辨率预览构建高分辨率证据集,联合证据定位与预算规划,自蒸馏提升长视频问答。

04:00
arXiv cs.LG

基于方差缩减序贯蒙特卡洛的特异性感知扩散引导

提出特异性感知扩散引导:以重叠目标设计分布,用方差缩减序贯蒙特卡洛采样,抑制负区域、减少模式偏移并稳定采样。

04:00
ArXiv AI

Kepler:面向 ARC-AGI-3 的可审计世界模型

Kepler以可执行世界模型表示假设并加以验证,在ARC-AGI-3公开25款游戏全获满分,表明公开集分数区分度有限。

04:00
arXiv cs.CV

为过多 Token 买单?基于简单启发式的有效且经济高效多模态 LLM 标注

系统评估短视频VLM标注启发式:准确率≠推断效度,单模态文本可能足够,2×8图像网格约15%成本达全视频理解。

04:00
arXiv cs.CV

VLM低层视觉表征中的几何相似性

提出GeoSim四层框架,分析24项低层视觉任务中AR与DiT表征的几何相似性,揭示共性组织原则及跨任务/模型局限。

04:00
arXiv cs.LG

EvoGen-Harness:学习在何处以及如何演化图像生成外围框架

通过失败归因引导多职责协同演化,在冻结T2I生成器外围自适应,显著超越单维度方法。

04:00
arXiv cs.CL

面向可解释语音音段分析的儿童适配结构化音系表征

PhonoQ-2.0适配儿童语音,清浊F1达0.97+,方式受监督影响,部位稳定,保留临床相关变化。

04:00
arXiv cs.AI

教育者引导的LLM教学智能体:面向概念数据库设计的支架式反馈

教育者引导LLM智能体,基于ERD与评分标准分四阶段提供支架反馈;383次中71.1%采纳隐藏诊断。

04:00
arXiv cs.CV

Lang3DSeg:基于点变换器的无标注开放词汇3D分割

Lang3DSeg首次以点变换器为骨干,实现无标注开放词汇室外LiDAR分割,修正投影深度歧义,两大基准均达最优。

04:00
arXiv cs.CL

DeBERTa-ConPara:攻击感知且面向真实部署的 AI 生成文本检测

提出DeBERTa-ConPara,推理端Unicode归一化有效,RAID隐藏测试AUROC达99.61%,主要提升同形字与零宽空格攻击检测。

04:00
arXiv cs.LG

MatrixReward:面向开放式生成的基于评分标准矩阵的奖励

提出MatrixReward,用rollout×rubric胜率矩阵构建奖励,以列离散度与相关性加权,借正负理想画像距离评分,四基准均分63.02,超基线约2.0%。

04:00
arXiv cs.CL

上下文关系的几何:语言模型按提及顺序寻址事实

大模型按提及顺序而非名称定位事实,形成共享、低秩、可操控的事实地址,随预训练涌现。

04:00
arXiv cs.LG

用于预测rTMS抑郁症治疗结局的时频图像融合技术

融合EEG时频图像并用轻量CNN预测rTMS抑郁疗效;严格受试者不交叉验证下性能崩溃。

04:00
ArXiv AI

面向交互策略快速适应的元多智能体强化学习及其在自动驾驶中的应用

提出元多智能体强化学习框架,建模马尔可夫博弈并定义元纳什均衡,实现交互策略快速适应,自动驾驶中优于基线。

04:00
arXiv cs.LG

OmniMed-Jev:通过 System One 校准 LVLM 置信度,实现可信的医学多模态决策。

OmniMed-Jev以候选集概率分布建模医学决策,替代生成式文本输出,显著降低校准与可靠性误差。

04:00
arXiv cs.CL

ReHoPER:面向增强推理的滚动时域规划

免训练零样本方法,滚动时域迭代规划并回答中间问题,多路径推进,任务无关,组合推理提升显著。

04:00
arXiv cs.CV

先对齐,后推理:面向配音的多模态唇同步评判器

提出无参考ATR多模态唇同步评判器:对齐唇动帧与文本音素后推理内容与时序,七语种及配音任务AUC显著提升。

04:00
arXiv cs.CV

SmoothOperator:通过调制标签平滑增强细粒度开放集识别表征

提出SmoothOP,按样本显著度动态调制标签平滑,提升细粒度开放集识别表征,最高增益4.7%。

04:00
arXiv cs.CL

大语言模型中的高效任务适配:基于权重、基于提示与基于嵌入的适配综述

综述提出统一框架,按任务信息存于权重、提示或注入嵌入分类高效适配,分析优劣、范式关系与开放问题。

04:00
ArXiv AI

目标条件强化学习中的多时间尺度学习

提出GITA,多时间尺度优势加权监督训练统一策略,OGBench成功率较HIQL提升25个百分点。

04:00
arXiv cs.CL

超越排行榜:智能体小型语言模型集成的 Token 经济学

小型模型智能体集成以更低成本在 IFEval 达 97.34%,超最强 LLM 基线 5.81 个百分点,并剖析其 Token 经济性与运行特性。

04:00
arXiv cs.CL

面向对话式大语言模型的角色感知启发式情景注意力

提出REA框架,分设指令与情景记忆并启发式检索历史,缓解注意力污染、稀释与漂移,提升对话指令遵循。

04:00
arXiv cs.LG

T2SPO:面向智能体强化学习的轨迹到步骤策略优化

T2SPO用成功轨迹估计剩余距离,生成步骤级辅助信用,在ALFWorld与WebShop上超越GRPO。