62275 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.AI

GRASP:面向战略规划的智能体AI生成、修订与评估

GRASP是策略感知的多阶段规划框架,通过生成、修订、评估模块化协作,大幅提升复杂任务规划准确率并消除多任务性能退化。

04:00
arXiv cs.LG

皮层-小脑环路中误差与预测驱动的运动学习

提出小脑启发框架,融合多路预测与内部反馈,编码运动学与误差信号,实现延迟下在线校正并使适应提速十倍。

04:00
arXiv cs.CV

Ego-Exo4D 人体网格数据集:面向自我—他人视角采集的4D人体运动重建

Ego-Exo4D仅有稀疏3D姿态,本文提出大规模4D人体运动重建数据集Ego-Exo4D-HM及配套重建流程。

04:00
arXiv cs.AI

面向Roblox游戏搜索中多组件查询理解的搜索感知强化学习

提出蒸馏后强化学习框架,按组件用搜索实时反馈奖励优化查询理解,NDCG@20较SFT提升8.9。

04:00
arXiv cs.CV

基于免训练轨迹路由的视频扩散加速

TRACK通过校准比较大小模型的预测差异,将低差异步骤路由至小模型,无需训练即可加速视频扩散推理,最高提速2.7倍。

04:00
arXiv cs.CV

OmniFabric:面向三维服装重建的连贯UV空间纹理合成

OmniFabric在缝纫图案空间合成全局连贯纹理,用扩散Transformer在UV域精炼去伪影,生成可重光照的逼真3D服装。

04:00
arXiv cs.LG

追踪状态还是追踪陪集?学习到的状态追踪的代数解释

模型学群元素乘积时追踪陪集而非精确状态;部分精度由陪集大小决定,子群陪集结构揭示学习阶段与内部计算。

04:00
arXiv cs.LG

超越平均安全:机会约束的大语言模型微调

提出机会约束微调框架,限制安全样本退化比例,采用可微违规率替代与约束感知梯度下降,实验验证优于基线。

04:00
arXiv cs.AI

Jev-Mobile:以Jev作为移动GUI智能体的执行器

Jev-Mobile让VLM低频规划、Jev高频执行GUI动作,成功率79%,成本降73.4%。

04:00
arXiv cs.CL

ExplorationBench:衡量AI系统在可验证异世界中的探索能力

发布ExplorationBench基准:以规则可执行、与常识相悖的可验证异世界沙盒,评测AI能否通过探索获取并应用全新知识。

04:00
arXiv cs.CL

用可渲染程序进行多模态思维

SVGLM用SVG基元连接文本与图像推理,构建SVG图像编辑数据集,使VLM能"边想边画"。

04:00
arXiv cs.CV

WanPE:面向现代文本到视频生成的电影级提示增强

WanPE以397B参数、105万视频训练,实现电影级镜头规划,30秒视频人类偏好提升50.86分。

04:00
ArXiv AI

SAGE:通过拓扑引导缓解长时程推理偏差

SAGE以代数稀疏化和双曲结构引导缓解长时程推理偏差,多基准领先,Andrews-Curtis任务提升达8倍。

04:00
arXiv cs.CL

在扩散语言模型中实现近似联合采样

提出轻量采样器,使扩散语言模型单次全模型前向可近似联合采样多个词元,兼顾并行与精度,MAUVE达0.87。

04:00
arXiv cs.AI

人工智能在科学中的应用:早期洞察

多源数据显示:科学家广泛使用AI,其与专业模型互补,每周省约7小时,但瓶颈下移、验证需求激增。

04:00
ArXiv AI

电子健康记录信息检索的动态基准

提出可自动生成EHR问答的可持续基准BRIE,经19名临床医生验证,揭示LLM常遗漏关键临床信息。

04:00
arXiv cs.CV

TrackEverything:通过去重三维场景表示实现长时程稠密跟踪

提出TrackEverything,将视频表示为持久三维场景轨迹并去重,实现超千帧全点稠密三维跟踪,性能领先。

04:00
arXiv cs.LG

让训练引导选择:基于真实锚定效用的在线合成数据过滤

FROST以真实数据梯度反馈衡量合成数据效用,在线过滤约两至三成合成样本,在图像分类、文本转SQL与工业广告重排中均显著提升真实任务性能。

04:00
arXiv cs.CV

多模态大语言模型中的对齐幻觉

逐层视觉-文本相似度并非内容级对齐;受控干预揭示标量指标可被权重诱导,提出主角度间隙诊断,需任务证据校准。

04:00
ArXiv AI

AD-WM:面向反事实模型预测控制的动作判别式世界模型

AD-WM提出动作判别式世界模型,用动作恢复正则保留动作信息,提升反事实MPC规划与迁移成功率。

04:00
arXiv cs.CL

PoEM:基于现有策略预测强化学习结果

提出PoEM,利用已有奖励后训练模型,免额外强化学习即可预测新奖励下的策略,并在文本图像任务验证。

04:00
arXiv cs.LG

多样几何、冻结权重:基于因果专家集成的稳健异质性处理效应估计

提出几何多样、权重冻结的GeoACE因果专家集成,提升异质性处理效应估计稳健性,但非普遍最优。

04:00
arXiv cs.CV

基于智能手机的自动化测速执法方法

设计并测试智能手机自动测速与车辆识别流程,辅助交通执法;识别准确率有限,并探讨法律、技术与实践问题。

04:00
arXiv cs.CL

OpenAI o1 评测:通用人工智能的机遇与挑战

对OpenAI o1的跨领域复杂推理评测显示其表现优异,部分超越人类,迈向AGI仍存局限。

04:00
arXiv cs.CL

信任还是不信任:语音中的检索增强事实核查

提出VeriSpeak语音事实核查基准,含3879条声明,揭示文本-语音模态差距,检索结合显式推理可使准确率达86.1%。

04:00
arXiv cs.CV

BiCC:用于实例感知分割的双向连通分量损失

提出BiCC,联合标注与预测连通分量,按预测实例惩罚假阳性,平衡病灶精确率-召回率,提升分割F1。

04:00
ArXiv AI

具有自适应加权与效率评估的混合变分量子-经典框架

提出Sim-HVQC混合量子-经典网络,以无参SimAM自适应加权保留判别特征,在多类数据集上验证参数效率与可解释性。

04:00
arXiv cs.CL

语言特定知识:模型在X语言中比英语懂得更多吗?

提出语言特定知识,发现换用非英语乃至低资源语言可提升问答表现,需为查询选择最优语言。

04:00
arXiv cs.LG

Canopy:利用分段平滑树先验的多保真度赌博机

CANOPY用随机路径探测在线检测平滑违背,引导多保真树赌博机的昂贵评估,提升LLM推理优化表现。

04:00
ArXiv AI

CaliPPer:量化、预测并提升AI模型在结合预测中的性能

提出CaliPPer框架,可量化、预测并提升结合预测AI模型性能,提高新抗原与变异体发现率。

04:00
arXiv cs.CL

大语言模型基础

本书聚焦大语言模型基础,涵盖预训练、生成模型、提示、对齐、推断与推理,适合学生、从业者及感兴趣者。

04:00
arXiv cs.LG

以近为靶,可达远方:你的冻结世界模型比你想的更会规划

冻结视觉世界模型直接以目标图评分会限制控制;用检索到的中间目标做锚定规划,无需训练即可提升长程规划。

04:00
arXiv cs.LG

带自举的随机算子收缩框架:在时序差分学习中的应用

提出随机算子收缩框架分析带自举迭代,无需梯度结构,允许采样误差随迭代增长,获均方几何收敛界并用于TD

04:00
arXiv cs.CL

基于人类反馈的会中交互式说话人纠错

提出LLM辅助会中说话人纠错,用户反馈修正归属;AMI上DER降31.99%、替换错误降52.68%

04:00
arXiv cs.LG

基于可达性的含节点和边特征的图神经网络形式化验证

提出GNNV,将NNV扩展至图结构,用GraphStar集建模节点和边特征不确定性,验证GCN/GINE,在电力与图分类任务上提供更紧且首个边感知鲁棒性保证。

04:00
arXiv cs.CV

冻结超球面特征能否指导伪掩码选择?

用冻结自监督超球特征评分排序候选伪掩码,八池中六池平均分割精度超基线1.7至9.3个百分点并助训练。

04:00
arXiv cs.CV

迈向实用的3D高斯泼溅压缩

COSA-GS通过锚点因果分解构建上下文,简化架构并实现跨平台一致的熵解码,达到先进压缩性能。

04:00
arXiv cs.CV

基于DCGAN的合成增强能改善脑肿瘤MRI分类吗?一项实证研究

DCGAN合成增强未提升脑肿瘤MRI分类,准确率与F1不变、AUC略降,需评估其分布保真度与任务效用。

04:00
arXiv cs.LG

面向大规模铁路网络管理的图推理与拓扑感知多智能体强化学习

提出图推理与拓扑感知多智能体强化学习框架,建模铁路维护环境,零样本迁移至大规模网络,性能优于基线。

04:00
ArXiv AI

框架背后是谁?通过智能体行为对LLM进行指纹识别

LIDAR:利用编码智能体运行时决策与动作行为,黑盒指纹识别模型身份,精度超越四个基线。

04:00
arXiv cs.AI

CrossScale-GLIO:面向弥漫性胶质瘤的 MRI 与全切片组织病理学的拓扑保持视觉-语言对齐

MRI与病理建模为肿瘤生境图与细胞微环境图,用语言锚定的结构感知最优传输对齐,证明拓扑保持驱动跨尺度对应。

04:00
arXiv cs.CL

校准还不够:评估语言变化下的置信度估计

提出鲁棒性、稳定性与敏感性三维评估框架,揭示现有置信度估计难以区分语义不同答案的缺陷。

04:00
arXiv cs.LG

论对数凹分布的平方和可认证性

证明各向同性对数凹分布的多项式为平方和,去除庞加莱常数依赖,恢复最优矩界,并得到高效无维误差算法。

04:00
arXiv cs.CV

最小二乘相位解缠的自适应分块:运行时间与精度

自适应分块虽减少块数,但构造与求解开销超过边界节省,仍慢于优化网格,精度也可能下降。

04:00
arXiv cs.AI

KathDB-FAO:多模态数据库管理系统中的合成查询计划

多模态数据库查询子系统,将自然语言转为按需合成算子执行计划,成本降58.8%,质量不降。

04:00
arXiv cs.AI

网络智能体何处受阻:多阶段LLM智能体的瓶颈分析

多阶段LLM网络代理瓶颈:验证器乐观,凭证与横向移动任务受阻;需综合结果、证据、资源与适应评估。

04:00
arXiv cs.CL

IDRBench:深度研究智能体交互能力基准测试

提出IDRBench评测深度研究智能体交互;交互平均提升对齐6.39分,但非总有效,取决于提问与反馈利用。

04:00
ArXiv AI

持久计费状态:工具调用型LLM智能体中的“钱包拒绝服务”攻击与防御

工具调用LLM智能体可因保留外部工具返回形成持久计费状态,遭钱包耗尽攻击;提出基准与重摄入前四重防御。

04:00
arXiv cs.AI

随机大语言模型的推测性评估

提出HBN推测评估,在固定rollout预算下优化分配,平均降方差12.8%–33.6%,异步版缓解同步开销。

04:00
arXiv cs.LG

AT-SKM-Net:面向动态图线性硬约束可行性的加速可训练采样Kaczmarz-Motzkin框架

提出AT-SKM-Net,以拓扑感知GNN混合采样和Cholesky更新,加速动态图线性硬约束可行性求解,迭代最多降85%且零违规。