59565 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CL

可靠但设计敏感:大语言模型标注中的工具不确定性

大语言模型标注可重复,但换任务设计或模型即变,称为工具不确定性;置信度不能替代多设计比较。

04:00
arXiv cs.CV

MSU 团队 GenText-Forensics 2026 挑战赛技术报告

提出分解式思维链流水线,结合篡改检测器与双视觉语言模型,获挑战赛第三名。

04:00
ArXiv AI

深入CHOIR:自由列举式引出揭示大语言模型集成中的独特模型之声

提出CHOIR框架,以自由列举法探测LLM集成,区分表层共识与深层差异,识别各模型独特声音。

04:00
ArXiv AI

AIM:面向自动化研究的智能体式想法管理

提出AIM框架,用智能体代理与采集机制组织并优选研究想法,维护想法与实现一致,动态分配预算,优于基线且快3.1倍。

04:00
arXiv cs.CV

超越层级:统一多模态模型的位置分辨梯度冲突与位置感知调制

发现生成-理解梯度冲突随视觉token位置变化,提出位置感知调制,仅在高冲突位置去除反对齐梯度,提升统一多模态模型性能。

04:00
arXiv cs.LG

MILO:通过编排式多智能体演化实现自动化智能体执行框架发现

MILO以编排式多智能体演化,协同发现更优智能体执行框架与搜索策略,多基准超越SOTA并刷新数学上界。

04:00
arXiv cs.CL

通过受控环境干预构建具有挑战性的浏览器使用任务

用受控环境干预把难度变为可编程属性,构建BreakingWeb基准:519对任务使智能体通过率降22.9%,失败多为虚假成功。

04:00
arXiv cs.CV

VidHarness:面向低成本长视频理解的可进化智能体框架

VidHarness以MCTS进化智能体框架,借多保真验证与混合路由降本,在多项长视频理解基准上刷新SOTA。

04:00
arXiv cs.CL

τ-多语言:跨语言语音智能体基准测试

推出τ-多语言基准,覆盖五种语言全双工通话评测:韩语、普通话完成率明显落后,失败模式各异。

04:00
ArXiv AI

解码延迟反馈预填充:一种无模型控制器及其泛化极限

无模型控制器DLFP以解码延迟反馈调预填充分块,A100上P99令牌间隔降27.7%,但泛化受限。

04:00
arXiv cs.LG

无需训练的合成:面向表格、时序与关系型合成数据的纯推理流水线

免训练纯推理流水线:统计画像与语言模型约束生成可审计采样器,统一支持表格、时序和关系数据。

04:00
arXiv cs.LG

基于可回收单元门控的循环神经网络动力系统持续学习

提出可回收单元门控CRUG:L0门控选择并回收任务单元,零遗忘持续重构动力系统,兼顾容量,可迁移至认知任务。

04:00
arXiv cs.CL

PrimeSeeker:面向能力的深度搜索智能体监督

提出潜在锚点推理与PrimeSeeker框架,以锚点结构生成问题及证据骨架,监督并强化训练,减少检索冗余。

04:00
arXiv cs.AI

PrivMeSA:面向医学的隐私感知自演化多智能体系统,基于本地—远程大语言模型协作

本地智能体以强化学习平衡准确率与隐私风险,用经验记忆复用远程知识,披露率由98%降至0.2%。

04:00
arXiv cs.CV

MOBA-VL:面向实时MOBA解说的赛事事件定位多轮强化学习

MOBA-VL以遥测定位事件、多轮强化学习训练9B模型,实时解说总分领先,事件召回率升至42.1%。

04:00
arXiv cs.CV

LoopVL:循环视觉智能

LoopVL将循环Transformer扩展至视觉语言模型,共享模块迭代更新多模态状态,性能超越更大模型并现视觉顿悟。

04:00
arXiv cs.LG

从随机探索中学习规划

仅凭随机探索,用条件能量模型学习多尺度时间关系,无需动作与奖励标签,实现长程迷宫规划与导航。

04:00
arXiv cs.CL

追踪语言模型中谄媚性认同的机制

因果中介分析揭示,早期少数注意力头把用户观点注入残差流并偏置答案;消融可显著减谄媚而不损准确性。

04:00
arXiv cs.CV

可听世界模型:面向3D世界的空间感知声音生成

免训练框架将声音融入3D世界:语义分层定位声源并锚定几何,渲染随听者移动的空间音频,空间一致性更强。

04:00
arXiv cs.CL

更少均匀的离散扩散更强大且可扩展

提出LUDI:非均匀损失加逐词元时间嵌入,提升少步生成;7B模型可复杂推理,比自回归解码快3词元/步。

04:00
arXiv cs.CV

PAMI:面向文本到人体-物体交互生成的部位锚定运动框架

PAMI用身体部位锚点投票定位物体运动,粗到细生成并细化接触几何,接触召回率较此前最佳提升14.5%。

04:00
arXiv cs.LG

论同策略蒸馏中的异策略教师

同策略蒸馏中教师监督学生前缀为异策略;SCOUT协同训练教师适配,提升蒸馏效果。

04:00
arXiv cs.CL

我们还能信任灾害社会感知吗?检测人工智能生成社交媒体帖子的实证证据

实证表明,文本AI检测难辨人类与AI生成灾害帖,不宜作信任门槛;需多模态、可问责来源等证据。

04:00
arXiv cs.CV

面向任务特定视觉感知的合成数据策划

核心不是生成更多,而是生成什么:按任务设计场景、外观与标注;程序化渲染、物理仿真与生成式AI各有所长,须与真实数据互补。

04:00
arXiv cs.LG

LeanPolish:面向Lean证明压缩的经核验监督

发布3.3万条经验证Lean编辑与候选池,揭示首次成功搜索捷径;符号迭代与微调提升压缩和整证明重写。

04:00
arXiv cs.LG

面向射频逆向设计的模拟器精炼扩散

提出模拟器精炼扩散SRD,用可微代理梯度引导、高保真模拟器精搜,射频逆向设计S参数匹配最高提升21.2%。

04:00
arXiv cs.LG

哪些任务能在自监督学习中幸存?

研究同实例自监督学习的信息保留,用语义可恢复性及谱子空间刻画下游任务几何与少样本迁移。

04:00
arXiv cs.CV

基于视觉语言模型街景描述的行人路径感知安全估计

以视觉语言模型街景描述作可解释中介,估算感知安全并规划行人路线;实地验证相关性有限,基准提升未带来现场增益。

04:00
arXiv cs.LG

面向基于图像的连续控制的高斯与Beta策略分歧正则化模仿学习

DRIL将策略分歧转为强化奖励,少示教图像连续控制显著优于行为克隆;示教增多优势缩小,β行为克隆强。

04:00
arXiv cs.LG

梯度冲突能否预测理解—生成权衡?统一多模态模型中冲突度量有效性的受控审计

受控审计发现,梯度冲突指标与理解—生成权衡无显著相关,抑制冲突不改变权衡,其诊断有效性需验证而非假设。

04:00
arXiv cs.LG

ShamAN-Q:面向亚1比特LLM权重的Shampoo增强NanoQuant

提出ShamAN-Q亚1比特量化法,以稠密曲率替代对角几何,降低困惑度并提升零样本精度。

04:00
arXiv cs.AI

VAmoS Part Deux:更难、更真实的语音智能体仿真

VAmoS Energy基准含100通多请求语音客服电话,测试14种语音栈,完成率17.3%–44.7%,背景电视干扰降至8.6%。

04:00
arXiv cs.CL

解决金融数据缺失危机:面向SEC 10-K提取的生成式AI流水线

评估多款LLM从SEC 10-K提取四类财务数据,规模匹配复杂度可提高零样本准确率,消除数据缺失偏差。

04:00
arXiv cs.CL

超越上下文窗口:面向混合检索与长上下文语言模型的自适应熵驱动路由框架

提出EDAR,以预测熵推理时路由RAG与长上下文,保留97.4%精度,token开销降70.7%。

04:00
ArXiv AI

理性与敏感性:以医师专家为基准评估大语言模型的临床分诊建议

基准测试显示,LLM较医生更易建议不必要诊疗,且对性别与语气等临床无关扰动更敏感。

04:00
arXiv cs.CL

大语言模型组合任务中的因果与可解释结构

LLM组合任务中,关系信息随层从两词联合表示渐进组合为三词表示;因果相关表示可提升下一词预测。

04:00
ArXiv AI

AgBench:面向个人AI设备的智能体AI基准测试

提出AgBench基准套件,评估个人设备上智能体AI的本地、混合与云端执行,揭示成功率、延迟、成本与数据暴露间的权衡。

04:00
arXiv cs.CV

Aperture:面向遥感的免训练多尺度概念瓶颈

APERTURE:免训练多尺度概念瓶颈,融合四叉树路由与MLLM评分,在遥感SiFC上超越免训练和监督基线。

04:00
arXiv cs.CV

GazeFlow:从人类注视行为到生成式第一人称注视预测

GazeFlow将注视建模为任务与视觉显著性条件下的联合分布,用条件流匹配生成轨迹,性能达SOTA且更符合人类注视动态。

04:00
arXiv cs.CL

CruxBench:信息发现基准

CruxBench以信息价值评估LLM发现关键子问题的能力,前沿模型仍表现有限。

04:00
arXiv cs.LG

预训练与中期训练让什么可从奖励中习得?

预训练与中期训练提供可执行计算与检索,使奖励学会任务特定用法;源监督和记忆回放大幅提升成功率。

04:00
arXiv cs.CV

ThinkV2V:释放多模态大语言模型推理能力,实现指令引导的视频编辑

ThinkV2V让MLLM先推理再生成视频,结合渐进课程训练与推理时思考扩展,5B模型超越10B基线。

04:00
arXiv cs.CL

PACT:面向单 token 类型化决策的成对锚定校准调优

PACT将对比对的四项结构约束转为训练目标,提升单token类型化决策的稳健性与排序精度,精度持平而偏差更低。

04:00
arXiv cs.CL

除了关键时刻几乎与人无异:VoxParity 与声音本应改变的决定

VoxParity测试语音智能体:14行业183场景中仅11/23通过,错误偏向文字,规则提示仅部分弥补。

04:00
arXiv cs.CL

超球语义轨迹分析:映射学术预印本、专利信号与算力扩展中的技术扩散

提出超球语义轨迹分析,追踪预印本与专利技术扩散,发现大语言模型等子主题语义演化最快。

04:00
arXiv cs.AI

走向“模型即库”:面向低资源非洲语言的离线社区共建AI

提出MaaL:将社区录入的小型语音模型作为端侧依赖,实现离线、防幻觉的数据收集,服务低资源非洲语言。

04:00
arXiv cs.CV

LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation

04:00
arXiv cs.CL

面向高效视觉推理的问题特定知识图谱

提出VisKG:用强化学习把视觉内容转为问题特定知识图谱,滤噪保留推理结构,token更少且更准。

04:00
arXiv cs.AI

临床试验中人类—AI交互的定义与分类:一种多维人类—AI分类方法

提出多维框架分类临床试验人机交互,涵盖AI任务、人机关系、交互配置与人群;LLM辅助分类需人类判断。

04:00
ArXiv AI

人口统计多元主义:多元人类偏好分布的推理时建模

提出人口统计多元主义推理时框架,无需微调估计群体意见分布;JS距离降8.4%-26.4%,等权聚合最优。