10841 条条目 · 106 个活跃源
2026年9月14日
04:00
arXiv cs.CV

DenseTRF:面向手术场景稠密预测的纹理感知无监督表示自适应

DenseTRF利用槽注意力学习纹理感知表示,无监督自适应目标分布,提升手术稠密预测的跨域泛化能力。

04:00
arXiv cs.CV

无人知晓地理空间基础模型的最新技术水平

地理空间基础模型缺乏统一评测,无法比较排名;审计发现跨论文分歧、配置各异且多不公开权重,故提出六项社区规范。

04:00
arXiv cs.CV

驳斥 Grad-ECLIP:关于其错误性及模型解释基本原则的综合研究

证明Grad-ECLIP实为注意力路线等价变体,其解释有误且偏离原模型性能,并提出两条解释原则。

04:00
arXiv cs.CV

MCSeg:面向多模态心脏图像分割的体数据金字塔Transformer预训练与微调

提出体积Transformer网络,用缩放特征金字塔衔接ViT与CNN,结合自监督预训练和区域互信息损失,在多模态心脏分割上超越11种SOTA。

04:00
arXiv cs.CV

基于集成跨域标签迁移的CT图像皮层下掩膜生成

提出集成框架,利用MRI模型跨域迁移标签,生成高质量CT皮层下分割数据集,实验验证有效并开源。

04:00
arXiv cs.CV

面向单帧菲涅耳相干衍射成像与重叠叠层成像的统一自监督框架

统一自监督网络实现单帧菲涅耳CDI与重叠叠层成像,免重叠稀疏扫描,泊松损失提剂量效率,重建快约36倍。

04:00
arXiv cs.CV

BodhiPromptShield:面向LLM智能体流水线中表层形式隐私传播的推理前提示词中介

提出BodhiPromptShield,在LLM智能体流水线推理前检测替换敏感跨度并延迟恢复,显著降低标识符暴露,语义泄漏评估需人工验证。

04:00
arXiv cs.CV

DiffusionOPD:扩散模型中同策略蒸馏的统一视角

提出多任务扩散训练:先训任务教师,再沿学生轨迹蒸馏;理论统一SDE/ODE,实验优于RL并达SOTA

2026年9月11日
04:00
arXiv cs.CV

MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

04:00
arXiv cs.CV

AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow

04:00
arXiv cs.CV

Rethinking Handwritten Character Recognition

04:00
arXiv cs.CV

Meta-Learning for Data-Efficient Plant Growth Estimation via Vision Transformers and Fuzzy Clustering

04:00
arXiv cs.CV

Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models

04:00
arXiv cs.CV

GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation

04:00
arXiv cs.CV

Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration

04:00
arXiv cs.CV

How Much Velocity Does Off-Ball Space Value Need? A Broadcast-Viewport Benchmark

04:00
arXiv cs.CV

TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs

04:00
arXiv cs.CV

Overpainting: Localized Context-aware Diffusion Image Editing

04:00
arXiv cs.CV

HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition

04:00
arXiv cs.CV

TailProp: content-adaptive light- and heavy-tailed propagation for vision

04:00
arXiv cs.CV

BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation

04:00
arXiv cs.CV

Evaluation of Vision-Language Models Across Diverse Coastal Environments

04:00
arXiv cs.CV

Symmetry-aware super-resolution of crystal orientation maps via invariant latent-space learning

04:00
arXiv cs.CV

Are We Really Doing Few-Shot Learning? A Critical Examination of Pre-Training Assumptions

04:00
arXiv cs.CV

CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation

04:00
arXiv cs.CV

New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models

04:00
arXiv cs.CV

Toward Interpretable Multimodal Fusion: Heat Conduction Modeling for Hyperspectral and LiDAR Joint Classification

04:00
arXiv cs.CV

Meta-Learning for Classifier Selection in Image Datasets: A Feature-Driven Framework for Accuracy Prediction

04:00
arXiv cs.CV

HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA

04:00
arXiv cs.CV

Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

04:00
arXiv cs.CV

ReconPlusGen: Injecting Reconstruction Prior into Multi-view 3D Generation through Noise Inversion and Modulation

04:00
arXiv cs.CV

LAION-Mobile: Evaluating Deepfake Detectors On One Million Smartphone Photos

04:00
arXiv cs.CV

UniH$^3$: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

04:00
arXiv cs.CV

Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval

04:00
arXiv cs.CV

CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach

04:00
arXiv cs.CV

Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization

04:00
arXiv cs.CV

A Multi-View and Confusion-Guided Ensemble Framework for Robust Synthetic Image Attribution

04:00
arXiv cs.CV

When is Test-Time Adaptation Identifiable From Unlabeled Evidence?

04:00
arXiv cs.CV

Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation

04:00
arXiv cs.CV

Mi-Ripple: Restoring Images Degraded by Iterative AI Editing

04:00
arXiv cs.CV

SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction

04:00
arXiv cs.CV

From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

04:00
arXiv cs.CV

Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes

04:00
arXiv cs.CV

SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views

04:00
arXiv cs.CV

Improving Faint Object Detection for Space Situational Awareness with Variational Autoencoders

04:00
arXiv cs.CV

Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma

04:00
arXiv cs.CV

GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT

04:00
arXiv cs.CV

Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models

04:00
arXiv cs.CV

R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds

04:00
arXiv cs.CV

Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness