59919 条条目 · 106 个活跃源
2026年9月30日
04:00
ArXiv AI

GeoWind2Plan:面向节能无人机规划的任务时三维城市风场预测

提出几何—风场—规划框架,用神经算子约3秒预测城市三维风场,CFD评估下较无风感知规划节能4.5%–12.7%。

04:00
arXiv cs.CV

FD-AA:一种用于胸部CT中偶发腹部异常检测的轻量级焦点-弥散与衰减感知分类头

FD-AA轻量器官感知头结合衰减感知与掩码广义均值池化,在冻结3D CT编码器上提升偶发腹部异常检测性能。

04:00
arXiv cs.CV

PreviewDiff:多模态评判器引导的扩散隐空间搜索

无需训练,在去噪中途解码预览,由多模态评判器反馈分支搜索并重噪隐变量,让验证算力在生成过程中主动引导。

04:00
arXiv cs.AI

话虽对,时不对:基于临床医生评审对年轻人与ChatGPT的19,930次对话中心理困扰的分析

分析近2万次年轻人与ChatGPT对话及临床医生评审,发现其痛苦时回应易过度,并提出三阶段设计指南。

04:00
arXiv cs.CV

LeRF:面向视角采择推理学习参考坐标系

训练视觉语言模型构建显式参考坐标系,先监督微调再强化学习,提升视角采择推理。

04:00
arXiv cs.CV

面向神经编码与解码的稀疏视角可解释三维动物行为表征

SABLE以自监督几何先验从稀疏视角重建可解释的三维行为表征,零样本泛化,助力神经编码与解码。

04:00
ArXiv AI

Mirror-Score:校准的仅推理评分揭示D-肽设计中序列兼容性排序的局限

提出Mirror-Score校准评分框架与31个复合物基准,揭示序列似然无法预测D-肽亲和力,镜像共折叠置信度家族内排序更可靠。

04:00
arXiv cs.CV

从敏锐之眼到专家思维:在 MLLMs 中内化专家知识实现篡改文本检测

提出 EKI 两阶段框架,将专家取证知识内化到 MLLM,解决双重不匹配,在篡改文本检测上达 SOTA 且推理高效。

04:00
arXiv cs.AI

SMat-Attention:结构化长上下文序列建模

以VC维d为可调旋钮构建结构化因果掩码,提出SMat-Attention,兼顾亚二次预填充与常数时间解码,并可扩展至Mamba-2等模型。

04:00
ArXiv AI

LongCat深度研究技术报告

提出LongCat深度研究系统,结合增强模型与多智能体工作流,分离全局规划与局部调查,支持分节修订,在多个基准测试中表现优异。

04:00
arXiv cs.CV

生成中的表示设计:扩散 Transformer 中的跨视图类令牌对齐

在扩散变换器中引入跨视图类令牌对齐,联合流匹配训练,提升表示质量且不损生成质量。

04:00
arXiv cs.AI

AI理解的复调式构想

LLM输出源于多个并行机制组成、可靠性不均的联盟;应据可靠控制输出的健全回路判断理解,以指导信任。

04:00
arXiv cs.AI

GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑的地理时空KGQA基准

提出GeoOutageBench基准,评测大模型地理时空KGQA的歧义理解、本体效用与多模态停电韧性分析能力。

04:00
arXiv cs.CV

三思而后修:笔画引导注意力的风险感知满文手稿修复

提出SAGE-Restore选择性修复框架,先评估需修复区域,以笔画结构线索与像素软门控,兼顾退化恢复与完好内容保留。

04:00
arXiv cs.CL

手握地图仍迷路:语言模型中的对话状态与行为可靠性

模型能读出对话结构却难解析值,旧值更新后仍影响行动;据此设计的控制器修正动作,显著提升查询与任务成功率。

04:00
arXiv cs.LG

潜在预测车辆表征保留了什么?测量状态、几何与局部响应

提出协议分测潜预测车辆表征的保留、预测与局部响应;其保留状态,但命令响应偏离模拟器。

04:00
arXiv cs.CL

智能体何时才有用?古典文本及其译本的嵌入、大语言模型与智能体对齐

七系统对比:生成式恢复率93-94%远超嵌入77%;智能体缺陷更少,但长文本优势经分块后消失。

04:00
arXiv cs.LG

Bison:面向未见化合物扰动预测的跨数据集学习

提出跨数据集联合训练模型Bison,利用药物对比监督预测未见化合物扰动,药物差异相关性提升27.4%。

04:00
arXiv cs.LG

论言语化置信度先验在大型推理模型校准中的陷阱

LRM置信先验集中于少数高值,抑制RL校准;CalibSFT先塑造校准先验,降低校准误差并提升判别力。

04:00
arXiv cs.CL

从细粒度修改操作到有意义的修改单元:评估大语言模型在修改边界检测中的表现

微调Qwen3-32B识别学生修改单元边界效果最佳,优于提示式大模型与启发式基线。

04:00
arXiv cs.CL

理解激活解释中的虚构并重新思考重建

点重建解释易致虚构与写作缺陷;提出Flow-NLA建模激活分布,保留效用并抑制缺陷。

04:00
arXiv cs.LG

SoFT:面向可泛化大语言模型微调的软目标

提出SoFT软目标微调,通过最小KL改动平衡演示学习与基座能力,提升分布内与分布外泛化。

04:00
arXiv cs.CL

共享经验、分离学习:面向大语言模型的伴随式置信度校准

CoCal以共享轨迹、分离学习训练轻量伴随模型校准LLM置信度,不损任务性能,优于RL与事后校准,并可跨域泛化。

04:00
arXiv cs.LG

联邦LoRA应共享什么?基于输入感知子空间对齐的FedSAIL

FedSAIL以输入二阶矩构建动作矩阵,其右奇异主子空间跨客户端对齐,据此正则本地训练并保留客户端系数,提升性能、降低通信。

04:00
arXiv cs.CV

面向统一多模态模型的演化数据相互对抗自训练

提出MATE,让生成与理解分支互相对抗自训练,挑战随模型演化,在Janus-Pro-1B上提升多项基准。

04:00
arXiv cs.LG

神经动力学即量化单元的组合

提出"量子"抽象:训练是按需求与条件复杂度有序获取可复用计算单元,可解释宏观损失与缩放律。

04:00
arXiv cs.CL

位置并非事实:KV 缓存与记忆之间的错配

更新KV缓存需保留单位、对象依赖与未变文本;重建旧位置会损历史准确率,识别需学习读出或查询访问。

04:00
arXiv cs.CL

渐进式指令交付对语言模型创意写作的影响

分多轮渐进交付写作要求会降低模型约束遵守度,结构连贯性受损最重,创意完整性仅存71.2%。

04:00
arXiv cs.CL

Unicode 中的约鲁巴文:一个问题概述

约鲁巴文 Unicode 缺预组合字符,跨平台显示、搜索和字体替换出错;呼吁联盟介入申请编码四个核心字符

04:00
arXiv cs.LG

Rondo:无监督发现重复性时间结构

Rondo 无监督发现连续时间流中层级的重复结构,动态扩展单元词表,在少数据与持续流中优于基线。

04:00
arXiv cs.LG

大型强子对撞机上快速精确的基于学习的带电粒子轨迹回归

提出双向门控线性循环编码器,带电粒子轨迹回归达经典拟合全精度,GPU推理加速,降低LHC计算成本。

04:00
arXiv cs.CL

语音识别中编码器-解码器模型的上下文自适应

编码器-解码器模型均能直接上下文自适应,最高相对提升30%,词法与说话人信息均起作用,拼接式演示最稳定。

04:00
arXiv cs.LG

面向一次训练、多预算导出的弹性选择性谱混合模型

ESSH融合选择性谱混合与滑窗注意力,联合训练多容量,一次训练多预算导出,质量近同级且解码加速。

04:00
arXiv cs.CL

LA-CPD:用于人类-LLM作者身份分段的局部证据感知变点检测

LA-CPD将句级噪声分数转为连贯作者分段,动态规划与AIC选变点,准确率升至0.796,边界定位更优。

04:00
arXiv cs.LG

Kolmogorov-Arnold网络与多层感知机中的Fisher简单性

KAN与MLP的Fisher简单性:死ReLU一致,KAN系数大小不能作剪枝准则,多层需有效路径。

04:00
arXiv cs.CV

StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

将长时程任务分解为可验证子任务,按完成进度给予结构化中间奖励,显著提升VLA长时程任务表现。

04:00
arXiv cs.CV

Merlin Plus:一个大规模、多癌种、图像-掩膜-报告数据集

首个含9器官肿瘤掩膜的大规模CT数据集,用报告驱动主动学习降低标注成本,支持癌症检测、分割与纵向分析。

04:00
ArXiv AI

AdaST:面向时空预测的自适应耦合

提出AdaST框架,以分解-重组自适应建模时空耦合模式,显著提升预测性能并超越现有方法。

04:00
ArXiv AI

CoRe:协同进化奖励模型以缓解视频扩散模型中的潜空间奖励劫持

CoRe让奖励模型与生成器协同进化,以真实视频偏好锚定,避免分布漂移引发的奖励劫持,提升视频生成质量。

04:00
arXiv cs.CV

高倍放大知识为何可迁移?全切片成像中的跨分辨率蒸馏研究

跨分辨率蒸馏中,重建误差不足以衡量迁移效果,学生预测能力与模型利用共同决定下游收益。

04:00
arXiv cs.CV

压缩以记忆:通过在线策略蒸馏学习紧凑记忆以实现长视频生成

提出PACC,用在线策略蒸馏训练压缩器,将历史帧压缩为紧凑记忆标记,不改生成器即增强长视频记忆与一致性。

04:00
ArXiv AI

FigAct:让科学图表成为可主动演绎的讲解画布

将静态科学图表转为按问题生成的视觉演示,通过元素定位与视觉动作引导注意力,使讲解更清晰易懂。

04:00
arXiv cs.CV

OTT3R:以1%算力实现多视角三维重建与快速数据集生成

以1.6%算力蒸馏出1.02亿参数学生模型,3.5小时生成66.7万张图像伪标签,精度超COLMAP且快980倍。

04:00
arXiv cs.CV

LEGO-Anything:面向三维场景重建的编码智能体

编码智能体迭代编写并执行Blender代码重建三维场景,并引入评测基准与改进插件。

04:00
ArXiv AI

记忆即推导:长期智能体中的分布式证据悖论

长期智能体记忆能否由历史推导存疑:扩展历史可找回近六成无据记忆,但17%-21%仍无据,准入不可靠。

04:00
arXiv cs.AI

潜空间递归大语言模型系统的原则性思考

REST把有效思维的因果、最小、可分、稳定四性转为可微损失,与交叉熵共训,准确率提升7.5个百分点。

04:00
arXiv cs.AI

VLA 的层之谜:VLA 潜在接口的信息论分析

VLA潜在接口选层:多层融合多不如最佳单层,最佳层随模型/任务变;InfoNCE代理选层,降遗憾。

04:00
arXiv cs.CV

面向鲁棒室外激光雷达定位的时序感知融合

提出TempLoc时序感知框架,结合全局坐标估计与不确定性引导融合,提升室外LiDAR重定位鲁棒性。

04:00
arXiv cs.CV

隐蔽性是关系,而非属性:事件表示如何为基于事件感知中的时序攻击制造盲点

事件表示使隐蔽性成为观察者关系;Null重定时攻击利用时序盲区,保持受保护张量不变并获高成功率。

04:00
arXiv cs.CV

面向可扩展、上下文感知的组织学图像单细胞空间转录组预测

CELLO单次前向并行提取全细胞特征,距离衰减注意力融入局部上下文,跨12器官千万细胞,提速14倍。