62344 条条目 · 106 个活跃源
2026年9月23日
04:00
arXiv cs.LG

上下文引导:通过数值基础模型学习任务间协同以实现少样本多任务优化

提出ICG-MTO框架,用冻结数值基础模型经上下文学习推断任务耦合引导,缓解少样本多任务优化负迁移并验证有效性。

04:00
arXiv cs.CL

校准应成为大语言模型评估的一级标准

现有基准多已具备置信度与正确性两项输入,校准可即刻报告;呼吁各子领域将校准与主指标并列,视其为模型必备属性。

04:00
arXiv cs.CV

ME-VLM:面向具身认知与智能体协同的统一视觉语言模型

提出统一视觉语言模型ME-VLM,融合具身认知与多模态智能体能力,兼顾多任务表现与端侧部署。

04:00
arXiv cs.CV

整合多模态超声与临床数据对肝细胞癌微血管侵犯的术前预测:一项多中心研究

多中心研究显示,整合多模态超声与临床数据可术前预测肝细胞癌微血管侵犯,外部验证AUC约0.90。

04:00
arXiv cs.CL

接纳而非谄媚:区分语言模型中的积极互动与顺从

社交谄媚评估与对话接纳性高度重合,或误罚可取行为;实验显示用户偏好更接纳的回应,并给出兼顾接纳与独立判断之法。

04:00
arXiv cs.CL

对使用大语言模型研究婴儿句法学习的回顾性分析

回顾大模型研究婴儿句法学习:方法论假设削弱理论解释,现实语料影响有限,模型与婴儿学习者存在计算差异。

04:00
arXiv cs.CV

动态热高斯:多模态4D高斯泼溅

提出首个动态RGB-热多模态4D重建框架,联合建模外观、温度与几何的时序变化,实现高保真时空重建。

04:00
arXiv cs.AI

架构师、对抗者与评审者:大规模闭环生成符合标准的评估题目

CLAIM闭环生成标准对齐评估题,通过率97.8%,但评审相对、一致性弱;选择题饱和,填空题难。

04:00
arXiv cs.CV

评估pCLE拼图配准的变换模型

建132对pCLE标注帧数据集,用TRE评估变换模型与六种匹配器:TPS最优,配对质量难预测拼图质量。

04:00
arXiv cs.LG

高斯流匹配调度:对采样与训练的影响

高斯流匹配调度可分解为方差路径与因子化,分别决定概率流与回归方差;据此优化采样与训练。

04:00
arXiv cs.CV

MIRAGE:面向智能眼镜的全身旁观者隐私保护与基于同意的恢复机制

MIRAGE三层架构守护智能眼镜旁观者全身隐私,支持合成替换与同意式加密恢复,掩码令轮廓重识别近乎随机。

04:00
arXiv cs.CV

真实图纸上什么得以保留:建筑文档视觉中的主动采样、连接组布线及匹配基线

冻结果蝇连接组模型在真实图纸上更鲁棒,小模型胜大网络;精确布线关键,但增益主要来自视网膜采样。

04:00
arXiv cs.CV

HyperCLIP++:在双曲空间微调CLIP实现开放词汇语义分割

HyperCLIP++双曲空间缩放嵌入半径对齐层级,DCRC同步双模态,仅调5%参数,三基准SOTA。

04:00
arXiv cs.LG

超越标量敏感度:激活感知的混合精度LLM量化与跨层细化

提出CASA两阶段法,以激活感知度量替代标量代理,并用跨层局部搜索,显著降低超低位宽量化的困惑度。

04:00
arXiv cs.CL

PersonaWeaver:程序化角色生成中超越传统原型的可控多样性

PersonaWeaver将世界构建与行为设定解耦,借助道德立场与对话反应库,使LLM角色生成突破默认模式,分布更趋多样。

04:00
arXiv cs.LG

评估 SechKAN 在一维数据上的有效性

SechKAN以双曲正割为基函数,在一维分类任务上与MLP、CNN等对比表现具竞争力,Crop尤佳。

04:00
ArXiv AI

无需说服的一致:单轮辩论抹去验证所需的分歧

一轮辩论即让评审团趋同却未提高准确率,抹去验证所需分歧;应先验证,勿把辩论后一致当可靠证据。

04:00
arXiv cs.AI

当大数据变成诅咒:空间异质性与被动声学监测数据学习的局限

被动声学监测数据空间异质、部署聚集,随机窗口验证高估跨站点迁移,需依赖感知验证和独立空间采样。

04:00
arXiv cs.CL

面向持续文档编写的知识拉取请求

提出知识拉取请求框架,抽取声明路由至章节并标记冲突,生成变更日志,使持续文档修订可解释且信息更全。

04:00
ArXiv AI

通过在线序贯检验识别智能过程

将识别大语言模型形式化为外层探针设计与内层序贯识别,用加权集合覆盖选探针,并界定识别所需评估次数。

04:00
arXiv cs.CL

测量的是服务栈而非模型:本地工具调用评估中的隐藏混杂因素

本地服务栈的模板门控与错误处理会左右工具调用评估,可致误判0%保真度,须纳入评估协议。

04:00
arXiv cs.LG

AURA:面向复值神经网络训练的角更新率自适应

AURA为复值神经网络提出逐参数步长自适应,按相邻复数更新一致性增减步长,可叠加于任意一阶优化器提速收敛。

04:00
arXiv cs.CL

扩散草稿,自回归验证:以自推测解码加速文档 OCR

GravityOCR以扩散起草、自回归验证加速文档OCR,端到端提速1.32倍。

04:00
arXiv cs.LG

GeoPair:面向免训练 Transformer 压缩的几何保持跨层因子分解。

免训练GeoPair优化跨层权重配对与共享字典分解,保持各层几何,结合结构化稀疏实现高效模型压缩。

04:00
ArXiv AI

守恒的代价:精确支撑生成的协调—记忆定律

加性守恒下精确支撑生成中,协调成本由守恒差游走谱决定,在线记忆可替代前置协调。

04:00
arXiv cs.CL

使用可解释的风格计量特征检测GPT辅助写作

可解释文体特征可区分学生独立与GPT辅助写作,随机森林ROC-AUC 0.87,词汇语法特征主导。

04:00
arXiv cs.AI

VACS:面向多智能体推理的价值对齐组合式屏蔽

提出VACS四层框架,对齐智能体价值、组合安全防护与冲突消解,提升准确率并降低逻辑不一致。

04:00
arXiv cs.CL

强大而简约:提取与刻画前沿模型中的隐藏思维链

通过API工具诱导前沿模型外化隐藏推理,其表现媲美原生CoT;Astra更高效定向,仅外化关键步骤。

04:00
arXiv cs.CV

FedMust:面向多器官CT分割的半监督多任务学生-教师联邦学习

提出半监督联邦多任务师生框架,利用标注与未标注数据提升多器官CT分割,平均性能增益13%。

04:00
ArXiv AI

基于目标导向智能体AI的泛在机器人用户自助维修探索

提出目标导向智能体AI,将自然语言转为分层目标,助非专家用户自助维修泛在机器人,完成率达95%。

04:00
arXiv cs.CV

基于动态与不确定性感知的树状高斯过程分类器的视频手术技能评估

融合表示流CNN与动态不确定性感知树状高斯过程分类器,设计语义感知复合核,手术技能评估准确率达96.9%。

04:00
arXiv cs.CL

SpeakerMem-R1:以说话人为中心的双轨记忆,面向多方对话

SpeakerMem-R1提出以说话人为中心的双轨记忆,融合逐字消息与结构化状态视图,提升多方对话归属与关系理解,多项基准领先。

04:00
arXiv cs.AI

EADC:大语言模型高级与深层合规性评估

提出EADC基准,基于合规知识图谱与专家构建4435+问答,揭示大模型深层合规盲点。

04:00
arXiv cs.LG

将边缘分布交织为多变量样本路径:面向概率时间序列基础模型的免训练依赖构建

免训练耦合冻结TSFM边缘分布为多元样本路径;历史时序与通道关系提升依赖诊断,依赖重建可作独立后处理。

04:00
arXiv cs.LG

探索神经网络验证的求解器级热启动

神经网络验证的求解器级热启动:利用历史解,在多数场景显著缩短验证时间,并可解出从零开始超时的实例。

04:00
arXiv cs.AI

自由配方极限:每个配方效应都在度量理想化学习者的哪条前提失效了

微调显示:配方搜索受可达集直径与分辨率限制,顺序效应不稳健,一致性是系统变量,规模是唯一可靠收益。

04:00
arXiv cs.CL

超越重复采样:为LLM推理学习搜索策略

训练小概念生成器作搜索策略,通过强化学习为大模型生成多样概念,提升困难推理并跨模型迁移。

04:00
arXiv cs.CL

Agensh:将组织智能扩展至1024个智能体

Agensh是无中心编排器的自组织多智能体框架,扩展至1024个智能体可显著提升复杂任务通过率。

04:00
arXiv cs.CV

高分辨率二氧化氮地图揭示欧洲暴露限值超标情况

机器学习绘制欧洲逐小时10米级NO2地图,发现91个监测达标区日均限值超标,约2000万人受影响。

04:00
arXiv cs.AI

TREND-10K:基于偏好驱动媒体的下一代视频质量评估综合数据集

提出TREND-10K,含1万视频,覆盖趋势与静态内容,支持技术、美学与AIGC痕迹三维VQA评估。

04:00
arXiv cs.CL

Flash-dLLM:面向快速、内存高效扩散大语言模型的I/O感知KV缓存与并行解码

免训练Flash-dLLM融合I/O感知KV缓存与并行验证解码,提升扩散LLM速度与内存效率。

04:00
arXiv cs.CV

Ev-YOLO:通过统一证据建模实现不确定性感知的目标检测

Ev-YOLO将分类与框回归统一为证据框架,输出可解释不确定性;精度相当且定位不确定性可识别错误检测。

04:00
arXiv cs.CV

MiTHras:面向核分裂象分析的任务特定分层半监督对比掩码自编码器

提出MiTHras,结合伪标签引导图像/令牌级对比学习与掩码重建,在核分裂象分析中表现领先,表征稳健可迁移。

04:00
arXiv cs.LG

BOBA:基于贝叶斯主动推理的动态贝叶斯优化

提出基于主动推理的BOBA采集函数,降低动态环境未来不确定性,提升移动最优追踪,查询受限下降低遗憾。

04:00
ArXiv AI

当验证器在裁决替换下反向投票:相关自洽性中的有符号枢轴值

裁决替换下验证器会反向投票;关键增益符号由状态准确率决定,强验证器受益、角色反转受损。

04:00
arXiv cs.LG

拟正则神经学习的动力学

神经网络可部分习得例外,继而回归主导规律、最终恢复;例外稀少时过度正则化更强。

04:00
arXiv cs.CV

什么造就了优秀的医学图像分词器?重新思考医学图像分词中的重建与生成

系统评测医学图像分词器,发现重建与生成强相关、隐空间利用率低、记忆轻且随压缩减弱、离散量化多保分类(查表法除外)。

04:00
arXiv cs.CV

ReSTI:基于源数据的 STI-Bench 审计与修复

审计STI-Bench发现坐标系、时间戳等错误,ReSTI基于源数据修复,保留1782题、排除282题。

04:00
arXiv cs.LG

群胚等变神经网络理论:一种有界域上的可操控 CNN 方法

提出群胚等变网络与双截面等变核定理,用于有界域可操控CNN;对称不可全局群作用时精度提升至少一个数量级。

04:00
arXiv cs.CV

GraphSVR:面向扩散MRI的q空间感知图神经网络切片到体积配准

GraphSVR:q空间感知图神经网络,实现扩散MRI四维切片到体积配准,严重运动下误差降73%。