全部OpenAIHugging FaceArXiv AIGoogle AIVentureBeat AIMarkTechPostPragmatic EngineerThe GradientOne Useful ThingCrunchbase NewsTechCrunchGoogle DeepMindMicrosoft ResearchLlamaIndex BlogarXiv cs.AIarXiv cs.LGarXiv cs.CLarXiv cs.CVNature Machine IntelligenceLilian WengAndrej KarpathySebastian RuderBAIR BlogAgile Lab EngineeringGoogle AI BlogMeta NewsroomMIT Tech Review AITechCrunch AIWiredFull-Stack AI EngineerAgentplexa16zSequoia CapitalY CombinatorElad GilTomasz TunguzNot BoringThe GeneralistSimon WillisonSimon Willison NewsletterLatent SpaceImport AIInterconnectsHamel HusainDAIR.AIEnterprise AI GovernanceStratecherySemiAnalysisBenedict EvansX @OpenAIX @claudeaiX @AnthropicAIX @karpathyX @samaX @demishassabisX @DarioAmodeiX @elonmuskX @miramuratiX @ilyasutX @gdbX @AravSrinivasX @arthurmenschX @ClementDelangueX @alexandr_wangX @mustafasuleymanX @ylecunX @geoffreyhintonX @AndrewYNgX @fcholletX @polynoamialX @_jasonweiX @DrJimFanX @rasbtX @lilianwengX @OriolVinyalsMLX @tri_daoX @percyliangX @ch402X @janleikeX @swyxX @simonwX @jeremyphowardX @OfficialLoganKX @svpinoX @SuhailX @emollickX @_akhaliqX @natolambertX @rowancheungX @bilawalsidhuX @Francis_YAO_X @ShunyuYao14X @tqchenmlX @haozhangmlX @GoogleDeepMindX @huggingfaceX @MistralAIX @perplexity_aiX @NVIDIAAIX @xaiX @victor207755822X @deepseek_aiX @bchernyX @Alibaba_QwenX @Kimi_MoonshotX @dotey
10841 条条目 · 106 个活跃源
2026年9月14日
04:00
arXiv cs.CV
DenseTRF:面向手术场景稠密预测的纹理感知无监督表示自适应
DenseTRF利用槽注意力学习纹理感知表示,无监督自适应目标分布,提升手术稠密预测的跨域泛化能力。
04:00
arXiv cs.CV
无人知晓地理空间基础模型的最新技术水平
地理空间基础模型缺乏统一评测,无法比较排名;审计发现跨论文分歧、配置各异且多不公开权重,故提出六项社区规范。
04:00
arXiv cs.CV
驳斥 Grad-ECLIP:关于其错误性及模型解释基本原则的综合研究
证明Grad-ECLIP实为注意力路线等价变体,其解释有误且偏离原模型性能,并提出两条解释原则。
04:00
arXiv cs.CV
MCSeg:面向多模态心脏图像分割的体数据金字塔Transformer预训练与微调
提出体积Transformer网络,用缩放特征金字塔衔接ViT与CNN,结合自监督预训练和区域互信息损失,在多模态心脏分割上超越11种SOTA。
04:00
arXiv cs.CV
基于集成跨域标签迁移的CT图像皮层下掩膜生成
提出集成框架,利用MRI模型跨域迁移标签,生成高质量CT皮层下分割数据集,实验验证有效并开源。
04:00
arXiv cs.CV
面向单帧菲涅耳相干衍射成像与重叠叠层成像的统一自监督框架
统一自监督网络实现单帧菲涅耳CDI与重叠叠层成像,免重叠稀疏扫描,泊松损失提剂量效率,重建快约36倍。
04:00
arXiv cs.CV
BodhiPromptShield:面向LLM智能体流水线中表层形式隐私传播的推理前提示词中介
提出BodhiPromptShield,在LLM智能体流水线推理前检测替换敏感跨度并延迟恢复,显著降低标识符暴露,语义泄漏评估需人工验证。
04:00
arXiv cs.CV
DiffusionOPD:扩散模型中同策略蒸馏的统一视角
提出多任务扩散训练:先训任务教师,再沿学生轨迹蒸馏;理论统一SDE/ODE,实验优于RL并达SOTA
2026年9月11日
04:00
arXiv cs.CV
MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery
04:00
arXiv cs.CV
AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow
04:00
arXiv cs.CV
Rethinking Handwritten Character Recognition
04:00
arXiv cs.CV
Meta-Learning for Data-Efficient Plant Growth Estimation via Vision Transformers and Fuzzy Clustering
04:00
arXiv cs.CV
Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models
04:00
arXiv cs.CV
GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation
04:00
arXiv cs.CV
Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration
04:00
arXiv cs.CV
How Much Velocity Does Off-Ball Space Value Need? A Broadcast-Viewport Benchmark
04:00
arXiv cs.CV
TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs
04:00
arXiv cs.CV
Overpainting: Localized Context-aware Diffusion Image Editing
04:00
arXiv cs.CV
HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition
04:00
arXiv cs.CV
TailProp: content-adaptive light- and heavy-tailed propagation for vision
04:00
arXiv cs.CV
BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation
04:00
arXiv cs.CV
Evaluation of Vision-Language Models Across Diverse Coastal Environments
04:00
arXiv cs.CV
Symmetry-aware super-resolution of crystal orientation maps via invariant latent-space learning
04:00
arXiv cs.CV
Are We Really Doing Few-Shot Learning? A Critical Examination of Pre-Training Assumptions
04:00
arXiv cs.CV
CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation
04:00
arXiv cs.CV
New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models
04:00
arXiv cs.CV
Toward Interpretable Multimodal Fusion: Heat Conduction Modeling for Hyperspectral and LiDAR Joint Classification
04:00
arXiv cs.CV
Meta-Learning for Classifier Selection in Image Datasets: A Feature-Driven Framework for Accuracy Prediction
04:00
arXiv cs.CV
HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA
04:00
arXiv cs.CV
Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions
04:00
arXiv cs.CV
ReconPlusGen: Injecting Reconstruction Prior into Multi-view 3D Generation through Noise Inversion and Modulation
04:00
arXiv cs.CV
LAION-Mobile: Evaluating Deepfake Detectors On One Million Smartphone Photos
04:00
arXiv cs.CV
UniH$^3$: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration
04:00
arXiv cs.CV
Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval
04:00
arXiv cs.CV
CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach
04:00
arXiv cs.CV
Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization
04:00
arXiv cs.CV
A Multi-View and Confusion-Guided Ensemble Framework for Robust Synthetic Image Attribution
04:00
arXiv cs.CV
When is Test-Time Adaptation Identifiable From Unlabeled Evidence?
04:00
arXiv cs.CV
Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation
04:00
arXiv cs.CV
Mi-Ripple: Restoring Images Degraded by Iterative AI Editing
04:00
arXiv cs.CV
SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction
04:00
arXiv cs.CV
From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
04:00
arXiv cs.CV
Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes
04:00
arXiv cs.CV
SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views
04:00
arXiv cs.CV
Improving Faint Object Detection for Space Situational Awareness with Variational Autoencoders
04:00
arXiv cs.CV
Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma
04:00
arXiv cs.CV
GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT
04:00
arXiv cs.CV
Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models
04:00
arXiv cs.CV
R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds
04:00
arXiv cs.CV