ECCV 2026 Events with Videos
Prerecorded Videos
Recordings will appear in the days and weeks following the conference. Registration is required to watch them for a period of 3 months.
Orals
- Provable and Robust Wavefront Sensing via Self-Reference Interferometry
- Broadband Wide Field of View Imaging with Computational Mirrors
- Poppy: Polarization-Based Plug-and-Play Guidance for Enhancing Surface Normal Estimation
- PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment
- Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring
- Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
- Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding
- Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
- World Knowledge in the Weights: Reading Concept Circuits of Vision Transformers
- What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- Make Geometry Matter for Spatial Reasoning
- Heat Kernel Textures -- the Geodesic Gaussians That Do Not Splat
- NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics
- TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields
- Repurposing Geometric Foundation Models for Multi-view Diffusion
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- Geometric Context Transformer for Streaming 3D Reconstruction
- LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows
- GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation
- Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
- Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression
Posters
- Attention-based Vision-Language Memory for Spatial Reasoning
- RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction
- Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach
- StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction
- VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction
- Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating
- OmniX: Any-view and Any-time 4D reconstruction via Feed-forward Trajectory Fields
- Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
- ARC-Loc: Leveraging Azimuthal Ray Convergence as a Geometric Cue for Direct Cross-View Localization
- Compact Low-Cost Hyperspectral Imaging via Angular-to-Spectral Diversity Conversion
- EventSpecPS: Photometric Stereo with Multispectral Reflectance Using an Event Camera
- GKDT: General Keypoint Detection Transformer
- One-Shot Feed-Forward 360° Animatable Avatar via Inpainted UV-Space Gaussian Modeling
- VLA Knows Its Limits
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- Latent Fusion: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents
- PaD-GS: Leveraging Distortion Map for Panoramic Gaussian Splatting
- C3-Bench: A Context-Aware Change Captioning Benchmark
- GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens
- CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
- Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
- Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
- LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching
- WiFlow: Estimating Optical Flow using WiFi Channel State Information
- Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
- HIVE: Understanding Post Hallucination Reasoning in Vision Language Models
- Incremental Online Scene Reconstruction by 3D Gaussian Triangulation
- DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
- Novel View Synthesis as Video Completion
- SFD-Net: Sharp Feature Detection Network Based on Local Geometric Features
- Benchmarking Vision-Language Models for Microscopic Plant Image Understanding
- Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning
- UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
- AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing
- City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion
- DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming
- Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors
- To Adapt or Not to Adapt? Selective Adaptation for Vision-Language Models
- ESNE: Efficient Surface Normal Estimation for LiDAR Point Clouds with Sequential Modeling and Variability Guidance
- Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors
- Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding
- Edit3r: Instant 3D Scene Editing from Sparse Unposed Images
- Holo-Captioning: A Comprehensive Textual View of 3D Scenes
- GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures
- Token-Based Affordance Grounding with Large Vision-Language Models
- Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering
- VERITAS: A Multi-agent Co-scientist for Verifiable Image-Derived Hypothesis Testing
- Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction
- SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision
- TriNLOS: Triplane Representations for Neural Non-Line-of-Sight Imaging
- Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models
- Instant Expressive Gaussian Head Avatars at Over 100 FPS
- MLP Splatting: Object-Centric Neural Fields
- SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification
- Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
- StratoSplat: Taming Layered Regularities for Sparse Aerial 3D Gaussian Splatting
- Learning to Suppress SPAD-based LiDAR Flare
- SOMA: From Surface Observations to Muscle Anatomy
- Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields
- Identity-Preserving Human Reconstruction from a Single Image via 3D Token Inference
- Reflection-aware generative novel view synthesis
- Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Enhancing Embodied Reasoning and Grounding by Novel View Synthesis
- Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
- Do Flat Minima Improve Sparse Novel View Synthesis?
- RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation
- High-speed Imaging through Turbulence with Event-based Light Fields
- VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
- Dynamic World Generation Made Efficient
- Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis
- mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis
- StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
- Geometrically Consistent Multi-View Scene Generation from Freehand Sketches
- ViewSplat: View-Adaptive Dynamic Gaussian Splatting for Feed-Forward Synthesis
- Flash-Refine: Frustum-Guided Local Incremental Learning for Efficient 3D Gaussian Splatting Completion
- PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS
- Domain Generalization via Text-Anchored Information Bottleneck
- CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels
- PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
- λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy
- Don’t Mask Out the Background! Natural-Light Photometric Stereo via Illumination Reconstruction
- SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training
- Fast and Compact 3D Gaussian Splatting with Polarized Opacity Prior
- Large-Scale Light Field Synthesis from Videos Enables Geometrically Consistent Bokeh Editing
- Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation
- VoxAnchor: Explicit Voxel-Semantic Grounding for Spatial Understanding in Videos
- DINO-SLAM: DINO-Informed RGB-D SLAM for Neural Implicit and Explicit Representations
- 3D Gaussian Texture for Real-time Mesoscale Appearance Synthesis and Rendering
- Weather-Conditioned Depth Anything
- Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
- SyncFix: Multi-View Consistent Diffusion Refinement of 3D Reconstructions
- OneHSI: A Unified Hyperspectral Foundation Model with Physical Consistency
- Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents
- Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection
- CAM3R: Camera-Agnostic Model for 3D Reconstruction
- DICE: Disentangled Instance-Class knowlEdge prompt tuning via SAE for Vision-Language Models
- TurboMPLE: Joint Infrared Turbulence Mitigation and Physical Fields Estimation via Mutual Progressive Layered Extraction
- Stabilizing Deep Reconstruction Operators with Contractive Anchoring
- Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition
- The Sterkfontein Caves Dataset: A Novel View Rendering Challenge from the Cradle of Humankind
- ATOMIC: A Domain-Specific Vision-Language Model for Transmission Electron Microscopy
- NeLU3D: Neural Inverse Structured Light without Modeling the Projector
- A Mechanism-Driven Theory of Phase Transitions in Active Learning
- Any to Full: Prompting Depth Anything for Depth Completion in One Stage
- RAU: Reference-based Anatomical Understanding with Vision-Language Models
- CrossView: Can Vision-Language Models Reason Across Cameras?
- From Gaze to Meaning: An AI Agent for Unified Zero-Shot Grounding and Explanation
- Multi-view Multi-vehicle Driving Dataset for Novel View Synthesis
- Stable and Scalable Bundle Adjustment of Holistic 3D Structures
- Video Can Teach PAN-Sharpening: PSF-Aware Cross-Domain Supervision
- MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics
- VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
- COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing
- AVSplat:Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning
- Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction
- VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM
- MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing
- Natural Image Pretraining Improves Abstract Reasoning
- MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
- PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment
- CrossFeat: Bridging Imaging Modalities in Feature Descriptor Space
- SiPhy: Single-Image Physical Property Reasoning
- FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors
- TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models
- Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
- SkyLume: A Large-Scale Multi-Illumination Aerial Benchmark for Urban Scene Reconstruction and Beyond
- Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
- Poppy: Polarization-Based Plug-and-Play Guidance for Enhancing Surface Normal Estimation
- From Blobs to Spokes: High-Fidelity Surface Reconstruction via Oriented Gaussians
- Less is More: A Simple yet Effective Object-Centric Prompting Strategy for Vision-Language Reasoning in Autonomous Driving
- URoPE: Universal Relative Position Embedding across Geometric Spaces
- 3DGS3: Joint Super Sampling and Frame Interpolation for Real-Time Large-Scale 3DGS Rendering
- Active View Selection with Perturbed Gaussian Ensemble for Tomographic Reconstruction
- Diversity-Aware View Partitioning for Scalable VGGT
- DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing
- Provable and Robust Wavefront Sensing via Self-Reference Interferometry
- Learning to Deny: Action Denial in Multimodal Large Language Models
- LiteGS: a high-performance framework to train 3dgs in subminutes via system and algorithm codesign
- GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction
- Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting
- REFINE: Super-efficient Pruning for 3D Gaussian Splatting via Rendering-Free Primitive Importance
- Learning Physics-based Forward Model Corrections in Unrolled Networks for Diffuser-based Imaging
- Interact3D: Compositional 3D Generation of Interactive Objects
- SDSA: Shallow-Deep Squeezing Adapter for Vision-Language Models
- EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning
- E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation
- SMP-UWGS: Coupled Physics-Geometry Optimization for Scalable Multi-Partition Underwater 3D Reconstruction
- CoDePose: Multi-View 3D Human Pose Estimation via Coupled 2D-3D Denoising Diffusion
- Gender Bias in Vision-Language In-Context Learning
- Gaussians on Fire: High-Frequency Reconstruction of Flames
- Nexels: Neurally-Textured Surfels for Real-Time Novel View Synthesis with Sparse Primitives
- Seeing Isn't Orienting: A Cognitively Grounded Hierarchical Benchmark for Object Orientation in MLLMs
- HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
- GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
- HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting
- Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
- Drop-In Perceptual Optimization for 3D Gaussian Splatting
- UniGeo: Unifying Geometric Constraints for Camera-Controllable Image Editing via Video Priors
- Ranked Activation Shift for Post-hoc Out-of-Distribution Detection
- TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid
- CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming
- P-CORE: Self-Supervised Surface Consistency for Point-Based Neural Editing
- DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
- Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement
- Proto-Gaussian: MRI Modality Translation Based on Learnable Structural Prototypes and 2D Gaussian Splatting
- Visual Prompt Discovery via Semantic Exploration
- SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation
- PointGT: Simultaneous Geometric and Textural Editing for Point-Based Representations
- Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving
- PDF-Omni: Poincaré Dual Disk Distortion Field-based Recurrent Update for Omnidirectional Stereo Matching
- DPGS: A Diffusion-Prior Guided Framework for Large-Scale 3D Gaussian Splatting Reconstruction
- ∂DIBR: Differentiable Depth Image-based Rendering for Fast Novel View Synthesis
- Sticking Information in Plain Sight: Encoding and Detecting Hidden Stickers in the Real World
- Temporally Aware Densification for Dynamic 3D Gaussian Splatting
- Molmo-Point: Better Pointing for VLMs with Grounding Tokens
- SynLF: Zero-Shot Metric Depth from Light Field Cameras via Physics-Grounded Synthesis
- SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
- Asymmetric Anchoring: Opening the Black Box of MLLMs for Forgery Detection
- WilLaGS: Latent-Conditional 3D Appearance Fields for Robust Gaussian Splatting In-the-Wild
- ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
- FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation
- ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views
- ScenarioControl: Vision-language Controllable Vectorized Latent Scenario Generation
- Open Your Eyes: Benchmarking the Detection of Fabricated Realities and Weaponized Ethics in VLMs
- WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
- IndoorSplat: Enhanced Indoor Scene Reconstruction with Structured 2D Gaussian Splatting
- R3RECON: Radiance-Field-Free Active Reconstruction via Renderability
- From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
- ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
- Why Do Vision Language Models Struggle To Recognize Human Emotions?
- RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
- Video Generative Models as Geometry Learner
- AiSCREAM: Absolute Target Localization with Language-Conditioned Cross-View Alignment for Autonomous Vehicles
- BioMTBee: Biologically Constrained Multi-View Template-Based 3D Reconstruction of Bumblebee
- Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes
- GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents
- ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision–Language Models
- GlassGS: Geometry and Concept-Aware 3D Gaussian Splatting for Reflective Enclosures
- KISS-GS: 3D Gaussian Splatting Compression Kept Simple
- UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization
- SkySplat-OV: Generalizable Language Gaussian Splatting for Open-Vocabulary Scene Understanding from Sparse Satellite Views
- MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting
- From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation
- Towards Reliable Medical Large Vision-Language Models via Counterfactual Preference Optimization
- HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video
- MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
- Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space
- Generalized Biomedicine Discovery
- Anchored, Not Graded: How Vision-Language Models Fail at Slant-from-Texture Perception
- Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction
- When 3D Gaussian Splatting Recovers Real Surfaces
- WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images
- DIGS: Differentiable, Incremental, Global, Scalable Pruning for Language Models
- Geometry-Propagated Gaussian Splatting for Aerial Sparse Novel View Synthesis
- Real-Time LiDAR Gaussian Splatting SLAM via Geometry-Aware Covariance Coupling
- StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production–Living Simulations with Stardew Valley
- TPCNet: A Low-Light Image Enhancement Network Inspired by Triple Physical Constraints
- Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
- BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular priors
- GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
- WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation
- RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing
- SharpGS: Sharpness-Preserving 3D Gaussian Splatting with Differentiable Blur-Driven Density Control
- V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
- SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination
- StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views
- TDSR-VLA: Transition-aware Denoising Sequence Representations for Vision-Language-Action
- Under One Sun: Multi-Object Generative Perception of Materials and Illumination
- Minute4D: Training High-Fidelity 4D Gaussian Splatting in One Minute
- Estimating Individual Tree Height and Species from UAV Imagery
- MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- EGM: Efficient Visual Grounding Language Models
- Improving Sparse-View 3DGS Generalization via Flat Minima Optimization
- IRIS: Intersection-aware Ray-based Implicit Editable Scenes
- RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes
- World Reconstruction From Inconsistent Views
- TRiGS: Temporal Rigid-Body Motion for Scalable 4D Gaussian Splatting
- FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
- MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis
- EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development
- Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration
- FUSE: Filter-Free Unified Spatiotemporal Estimation of SpO2 via Wave-Transport Modeling
- Synthetic Sub-Aperture Phase Augmentation for Demosaicing 2×2 Shared Microlens Sensors
- Cast and Attached Shadow Detection via Iterative Light and Geometry Reasoning
- DIVA: Instruction-Aware Vision Token Pruning via Dual-Probe Attention Discrepancy
- GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence
- Sparse auto-regressive modeling for scene generation from multi-view images
- NanoGS: Training-Free and Lightweight Gaussian Splat Simplification
- SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
- DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis
- Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics
- UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables
- Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting
- Relaxed Rigidity with Ray-based Grouping for Dynamic Gaussian Splatting
- Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models
- 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
- VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
- TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
- ReGen3D: Generalizable Unified Representation Learning for 3D Understanding
- Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models
- Broadband Wide Field of View Imaging with Computational Mirrors
- HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding
- AdaBoosting Text Prompts for Vision-Language Models
- TopoGS: Planar Reconstruction via Topology-Aware 3D Gaussian Splatting
- Generalizable Neural Reconstruction of High-Fidelity Surfaces via Sparse Volumetric Representations
- UniFusion: Sparse-View 4D Reconstruction via Unified Spatio-temporal Depth Alignment
- DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing
- Direct Preference Optimization for Perceptual Alignment via Vision-Language Consistency
- Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
- Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners
- GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
- PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation
- LiDAR-EVS: Enhance Extrapolated View Synthesis for 3D Gaussian Splatting with Pseudo-LiDAR Supervision
- SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
- AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting
- FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting
- MonoSR: Open-Vocabulary Spatial Reasoning on Monocular Images
- Boosting 6D Object Pose Estimation via Monocular Depth Cues
- SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization
- GAP-Track: Bridging the Resolution Gap for Cross-Resolution RGBT Tracking
- The Devil Is in the Dark Pixels: Toward Brightness Bias-Robust Denoising
- From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs
- Gripper-aware Vision Language Action Models
- Show Me Examples: Inferring Visual Concepts from Image Sets
- AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs
- Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring
- Geometry Grounding: Elevating Blind Distortion Correction with 3D Structural Priors
- DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering
- Tackling Misattribution in 3D Intrinsic Decomposition via Proximity Attention Point Rendering
- Color Pass-Through via Camera-Display Coupling
- The 3D Mirage: Probing and Taming 3D Hallucinations
- ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision–Language Models
- Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses
- DASAM3D: A Unified Foundation Model for Enhanced 3D Scene Reconstruction and Segmentation
- Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
- ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
- Geometry-Aware Visual Representation for Remaining Useful Life Prediction
- GaINeR: Geometry-Aware Implicit Neural Representation for Image Editing
- VISOR++ : VISUAL INPUT BASED STEERING FOR LARGE VISION LANGUAGE MODELS
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- CURE: Cumulative Knowledge Reuse for Efficient Device-Server Hybrid Inference in Vision-Language Models
- Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
- Less is More: Reducing Complexity in Vision-Language-Action Systems
- Same Person, Different Depiction: Counterfactual Evaluation of Vision-Language Models on Individuals with Limb Deficiencies
- PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
- Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction
- LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization
- OmniRen: Neural Rendering wih Heterogeneous Scene Primitives
- Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth
- AdaptiveSplat: Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction
- EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
- AGE: Agentic Gaussian Editing in 3D Scenarios
- DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
- LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
- Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
- Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations
- Cube-Splat: High-Fidelity 360° Gaussian Splatting SLAM via Cubemap Factorization and Adjoint-Consistent Optimization
- FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness
- Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning
- Delineating Knowledge Boundaries for Honest Large Vision-Language Models
- EAGS: Error-Aware Gaussian Splatting with Dual-Confidence-Guided Modeling for Uncalibrated Driving Scenes
- ReSplat: Learning Recurrent Gaussian Splatting
- Racing in Volume with Flow Ensembles
- AIMold: An Autonomous AI-based Pipeline for Complex Mold Design
- PanoLess: Environment Reconstruction from Partial Reflective Views
- On Test-Time Scaling for Vision-Language Models
- Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models
- FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation
- CulinaryCut: A Physics-aware Vision-Language-Action Benchmark for Food Cutting via Material Point Method
- Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
- DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery
- NoPA: Non-Parametric Online 3D Scene Graph Generation
- Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning
- Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration
- TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
- FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement
- Tricam-rPPG: A Multimodal Multispectral Dataset for remote Photoplethysmography
- CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance
- InstGS: Shared-Template Gaussian Instancing for Object-Redundancy-Free Rendering
- CFM: Language-aligned Concept Foundation Model for Vision
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- Semantic Line Diffusion: Character-Consistent Line Art from text-annotated Storyboards
- The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models
- Towards More Efficient Decoding for Autoregressive Vision-language-action Models
- Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction
- The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
- Pixel-wise Planarity for High-Precision Monocular Plane Segmentation
- Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
- Learning from Primitive: Probing Visual Reasoning of LVLMs via Counting
- Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures
- Confidence-Based Mesh Extraction from 3D Gaussians
- EGGS: Explicitly Granular 3D Gaussian Splatting via Luma-Aware and Volume-Preserving Attribute Factorization
- NaVLM-PVC: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
- Geometry-Aware Style Transfer in 3D Gaussian Splatting
- Gradient sparsity regularization for training unlearning-compatible models
- TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs
- Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation
- Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding
- Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
- EoS-FM: Can an Ensemble of Specialist Models act as a Generalist Feature Extractor?
- UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras
- Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision
- Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection
- How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
- Triangle Splatting SLAM
- InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction
- Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering
- VICAL: Vicinal Consistency Alignment for Long-Tailed Visual Recognition
- Score-Based Matching with Target Guidance for Cryo-EM Denoising
- Proteus: Model Leakage-Induced Adversarial Attack in Federated Learning
- S3-Prune: Stability-Aware Token Budgeting for Long-Form Video-Language Models
- CLARITY: Medical World Model for Guiding Treatment Decisions by Simulating Context-Aware Disease Trajectories in Latent Space
- Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
- Do Multimodal LLMs Understand Intraoral Dental Data? Dataset, Platform, and Baselines
- MedRepBench: Benchmarking Structured Understanding of Medical Report Images
- Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation
- SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking
- REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception
- Off the Planckian Locus: Using 2D Chromaticity to Improve In-Camera Color
- LineGraph2Road: Structural Graph Reasoning on Line Graphs for Road Network Extraction
- Rethinking Temporal Modeling in Visual Object Tracking via Decoupled Auxiliary Supervision
- Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval
- HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers
- GTR: Guide-Then-Refine Token Compression for Training-Free Acceleration of Video-LLMs
- MoCA3D: Monocular 3D Bounding Box Prediction in the Image Plane
- Q-TriM: Question-Guided Tri-Modal Attention for Audio–Visual Question Answering
- From Script to Shot: A Benchmark for Grounding Screenplays in Movies
- Bayesian Self-Attention with Local Pixel Correlations for Lightweight Denoising Transformers
- 2D Features Are All You Need for 3D Shape Understanding
- LINA: Learning INterventions Adaptively for Physical Alignment and Counterfactual Generation in Diffusion Models
- SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions
- Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
- Demystifing Video Reasoning
- TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
- Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
- SlowBA: An efficiency backdoor attack towards VLM-based GUI agents
- TR-MoE: Temporal Reliability-Aware Mixture-of-Experts for Robust Tracking
- Accelerating Text-to-Video Generation with Calibrated Sparse Attention
- IDeaL: Data-Free Multi-Teacher Distillation via Improved Dead Leaves
- CLDefocus: Physically Grounded Compound-Lens Defocus Blur Synthesis
- VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
- Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
- Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
- CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
- NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices
- HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations
- Implicit Neural Representation Facilitates Unified Universal Vision Encoding
- Finding Highlight Images In Your Albums:From Benchmark To MLLM
- Robustness Emerges Early in Training Dynamics, but Is Not Preserved
- DiffVP:Differential Visual Semantic Prompting for LLM-Based CT Report Generation
- Explainability-aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors
- Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
- WARP: Wide Attention with Rich Projections for Image Super-Resolution
- Open-Vocabulary Long Term Action Anticipation
- STVFocus: Query-guided Spatio-Temporal Visual Focusing for Video LLMs
- Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data
- EgoCogNav: Cognition-aware Human Egocentric Navigation
- RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations
- EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video-LLMs
- Multi-Block-Attention-based Color Constancy
- PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning
- A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
- SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
- SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation
- RotateAttention : RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
- Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-visual Language Models
- D-VLAM: Differential Vision and Language Mixing for Rehearsal Free Continual Learning
- Leveraging Dark Knowledge for Intrinsic Multimodal Out-of-Distribution Detection
- Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
- Break Visual-Linguistic Asymmetry: Unleashing VLM's Cross-Modal Potential for General Face Forgery Detection
- MorphJEPA: Morphology-Aware Latent Prediction for Hyperspectral Images
- Closing the Capacity–Convergence Gap: Globally Optimal Configuration of Implicit Neural Representations
- Comprehensive language–image pre-training for 3D medical image understanding
- Proximity-Constrained Counterfactual Decoding for Hallucination-Robust Medical VQA
- BackTranslation2.0 - A Linguistically Motivated Metric to Assess Sign Language Production
- Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?
- AracNet: Revealing Debiasing Signals across Layers with Shallow Monitors
- Conversational Human Audio-visual Talking Dialogue Generation
- MOOZY: A Patient-First Foundation Model for Computational Pathology
- Exposing Implicit Vulnerabilities in Text-to-Image Models via Adversarial Agentic Probing
- Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions
- MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
- EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage
- OCTOPUS: Multi‑Agentic Universal Compositional Visual Retrieval
- Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration
- RIGS: Radar-Informed Gaussian Splatting for Uncertainty-Aware 3D Occupancy and Motion Prediction
- BiCE-HG: A Bi-Conditional Egocentric Hand Gesture Dataset for Intelligent Reality Systems
- Learn to Rank: Visual Attribution by Learning Importance Ranking
- Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing
- Escaping the Low-Frequency Bias: Adversarial Frequency Perturbation for Generalisable Gaze Estimation
- Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection
- Towards Reliable Multi-Label Classification via Conditional Dependency Modeling
- Neuromorphic X-ray Computed Tomography
- GeoDetect: Geometric Adversarial Detection for VLPs
- PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
- Surprise Forcing: What to Remember, When to Skip in Long Video Generation
- Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors
- Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers
- FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration
- Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection
- Structured-Noise Masked Modeling for Video, Audio and Beyond
- Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
- Scaling Laws for Black-box Adversarial Attacks
- Synesthesia via Direct Latent Augmentation: Bypassing the Decode-Encode Loop for Cross-Modal Distillation
- Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
- Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation
- Improving Adversarial Robustness by Mitigating Instability through Relearning
- STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation
- Event-based Sparse-view Background-Oriented Schlieren Tomography
- Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts
- Data Circuit Breaker: Identifying Training, Test, and Generated Data in Image Generative Models
- MomentSeg: Moment-Centric Sampling for Enhanced Referring Video Object Segmentation
- Learning to Mask: Cross-Modal Noise Modulation for Hallucination Mitigation in Multi-modal Large Language Models
- Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT
- InterEdit: Navigating Text-Guided Multi-Human 3D Motion Editing
- Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks
- PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
- EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation
- Physics-Guided Deep Learning for Linear Mueller Matrix Acquisition
- SHINE-PPG: Non-Lambertian Intrinsic Decomposition for Illumination-Robust rPPG
- SV-TAD: Native Sparse Convolutions for Efficient Temporal Action Detection
- Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
- Denoised Variance-Based Pruning with Optimal Brain Bias Compensation
- SeekFlow: Synergizing Radiology and Pathology Foundation Models for Precision Oncology via Knowledge-Guided Evidence Flow
- Adaptive Neural Dynamics for Robust Geometric LiDAR-Inertial State Estimation on UAVs
- Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks
- MArFE: Multi-Contrast MRI Arbitrary Scale Super-Resolution with Fourier Enhancement
- Multi-modal Knowledge Preserving Adapter for Embedding Backward Compatibility
- RobustRDP: Advancing Reaction Diagram Parsing via Synthetic-to-Real Data Scaling and Robustness-Oriented Training
- FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
- Gaussian Volumetric Representation for Efficient Shear–Warp Visualization
- NeuralDMD: Interpretable Untrained Neural Network for Imaging from Sparse and Noisy Observations
- Integrated Forward–Inverse Network for Reconstruction for Lensless Image Reconstruction
- ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
- HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
- ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation
- MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning
- Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
- Human-Level Accuracy, Non-Human Strategies: Revealing Model-Human Divergence in Video Physical Reasoning
- SpecEyes: Accelerating Agentic Multimodal LLM via Speculative Planning and Perception
- Unified Video Dense Prediction from Disjoint Data
- Don’t Teach Instability, Teach Robustness: Selective Sensitivity Gating for Adversarial Robust Distillation
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
- Hybrid Event–Frame Sensors: Modeling, Calibration, and Simulation
- DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders
- HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization
- MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
- When Higher Order Hurts: Pre-Asymptotic Order Collapse in Generative ODE Sampling — A Theory of Discretization–Learning Interaction
- Histopathology Multi-modal Embedding for Pathology Composed Retrieval
- REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation
- Fast and Accurate Image Restoration with Rank Enhanced Linear Attention
- On the Reliability of Cue Conflict and Beyond
- Zero-shot Depth from Defocus
- OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure
- FeVOS: Foresight Expression Video Object Segmentation
- Linear Scaling Video VLMs for Long Video Understanding
- Small Vision-Language Models are Smart Compressors for Long Video Understanding
- Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
- Remembering Across Blocks: Topology-Conditioned Block-Progressive Memory for Skeleton-Based Action Recognition
- Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
- 3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems
- DART: Deformable Adaptive Reasoning with Temporal Queries for Online Skeleton-Based Action Recognition
- DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution
- GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces
- Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG
- LogicIR: Logic Gate Networks for Image Restoration
- Spatiotemporal Flux Probing for Single-Photon Videography
- Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
- Compact and Structurally Transparent Cervical Cytology with Geometry-Driven Features and Closed-Form Attention
- OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization
- OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
- A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
- STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
- Urban Boundaries, Social Barriers: A Benchmark and Vision-Centric Framework for Mapping Gated Communities and Equity Implications
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- Objects as Audio-Visual Modal Sound Fields
- One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
- FeatTracker: Short- and Long-Range Temporal Feature Consistency for Robust Underwater Object Tracking
- REDistill: Robust Estimator Distillation for Balancing Robustness and Efficiency
- Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation
- DeRA: Decoupled Representation Alignment for Video Tokenization
- Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change Captioning
- ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
- Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
- GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition
- FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography
- Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation
- MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI
- Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution
- Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
- Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
- Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
- SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning
- ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
- Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions
- SurvMILKD: A Weakly Supervised Survival Analysis Framework for Multi-Teacher Knowledge Distillation using Pathology Foundation Models
- HIDA: A Human-Intuition-Guided Depth-Aware Framework for Zero-Shot Amodal Segmentation
- Quantile‑Adaptive Temperature Scaling for Confidence Calibration
- DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding
- Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition
- Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching
- MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
- Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning
- MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning
- Frames2Residual: Spatiotemporal Decoupling for Self-Supervised Video Denoising
- Audio-Visual Continual Test-Time Adaptation without Forgetting
- Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation
- Rethinking Training and Inference for Trajectory Forecasting: Linking Winner-Take-All back to GMMs
- RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement
- Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space
- Adapting MLLMs for Nuanced Video Retrieval
- Cambrian-P: Pose-Grounded Video Understanding
- VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation
- Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models
- Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
- STARLINC: Satellite Trail Artifact Removal using Inter-Frame Correlation
- TRAM: Finetuning-Free Test-Time Adaptation for Generalized Face Anti-Spoofing with Only a Few Bonafide Samples
- Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
- If It's Not Efficient, It's Not Usable: Real-Time OOD Detection with Latent De-Biasing and High-Quality Negative Samples
- Keep Your Friends Close, and the Right Neighbours Closer: Disaster-Conditioned Kernel-Regularized Graph Attention for Building Damage Classification
- Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation
- ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
- JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
- Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding
- Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space
- UniTemp: Unlocking Video Generation in Any Temporal Order via Autoregressive Distillation
- Masked BRep Autoencoder via Hierarchical Graph Transformer
- Natural Language Camera Movement Understanding
- Simple Filtering Improves Masked Autoencoders
- Safe Responses Matter: Output-Aware Safety Guardrail Mitigate Over-Refusal in MLLMs
- SMART: When is it Actually Worth Expanding a Speculative Tree?
- RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs
- GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine
- TopoGAT: Plug-and-Play Topological Graph Attention for Fine-Grained 3D Segmentation
- Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
- Puppet-CNN: Continuous Parameter Dynamics for Input-Adaptive Convolutional Networks
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- iSyncTab: Learning Cross-Modal Feature Sequencing for Image-Tabular Data via Neural Synchrony
- PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation
- NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling
- Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation
- ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space
- CUST : Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution
- Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
- Guiding the Blind: Generalizing GUI Agents to Unseen Websites via Multimodal Tutorials
- Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching
- GeoCFM: Positive-Only Conditional Flow Matching for Mineral Occurrence Sampling
- MegaFlow: Zero-Shot Large Displacement Optical Flow
- Transferability Between Understanding and Generation in Unified Multimodal Models
- DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data
- Parsimonious Flow Matching for Efficient Image Generation
- LIIFusion: Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation
- Test Time Training for Long Videos via Frame Forgetting Network
- Trajectory-Level Continuous Action Representation for Robotic Manipulation
- MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment
- EvDiff: High Quality Video with an Event Camera
- Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping
- InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation
- LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
- iMED: A Multi-Endoscope Dataset for Surgical 3D Perception
- Learning Probabilistic Prompt for Continual Learning
- Temporal and Cross-modal Alignment for Enhanced Audiovisual Video Captioning
- SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning
- Clue Matters: Empower Video Reasoning with Brain-Inspired Latent Clue Learning
- ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding
- Task-driven Processing with Coarse-to-Fine Glimpse-based Active Perception
- XPos3R: Cross-Modal Transformer for Intraoperative 2D/3D Registration
- AffoGato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale
- SVI360: Spherical Video Interpolation
- ProtoMappingNet: Interpretable Hierarchical Prototypes through Relational Prototype Mappings
- Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA
- Gaussian Belief Propagation Network for Depth Completion
- Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
- Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
- From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
- Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis
- Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
- PolarAPP: Beyond Polarization Demosaicking for Polarimetric Applications
- Pol-CACTI: A System and dataset forHigh-Speed Polarized Video Compressive Imaging
- Continuous Heart Rate Variability Estimation from Egocentric Systems for Skill Assessment
- Stokes-Informed Diffusion for Robust Linear Polarization Estimation
- MedCAGD: Context-Aware Gated Decoder for Robust Medical Image Segmentation
- MCPNet:Masked Coordinate Pooling-based Attention Network for Medical Landmark Detection
- ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion
- CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving
- Foundation-Guided Representation Alignment for Multimodal Medical Image Registration
- VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension
- Φeat: Physically-Grounded Material Feature Representation
- Conditional Flow Matching for Visually-Guided Acoustic Highlighting
- Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification
- From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology
- Defending from GeoLocalization through Adversarial Road Trips
- IConE: Batch Independent Collapse Prevention for Self-Supervised Representation Learning
- C3ASD: Multi-Level Consistency-Driven Representation Learning for Robust Active Speaker Detection
- QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
- LumiDepth: Stable Monocular Depth in Multi-Illumination Scenes
- Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation
- Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies
- No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs
- MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
- Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
- Bridging Theory and Practice in Source-Free Domain Adaptation via Adversarial Proxy Perturbation
- ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning
- Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation
- PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos
- SDUM: A Scalable Deep Unrolled Model for Universal Cardiac MRI Reconstruction
- EgoPHI: Estimating 3D Hand-Object Contact and Force from Egocentric Vision
- RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
- Topology-Weighted Effective Rank: A Zero-Cost Proxy for Training Dynamics Stability in Neural Architecture Search
- Fast and Flexible Robustness Certificates for Semantic Segmentation
- SPHERE: From MRI Sampling Mechanisms to Spatial Priors for Generalizable Brain Tumor Segmentation
- Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification
- MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
- Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
- EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
- Seeing What Matters: Lesion-Aware High-Resolution Patch Discovery and Fusion for Chest X-ray Report Generation
- EgoEverything: A Benchmark for Human Behavior–Inspired Long-Context Egocentric Video Understanding in AR Environment
- On the Plasticity Collapse in Continual Machine Unlearning
- Implicit Neural Representation for Spherical Harmonics Reconstruction of Motion-Corrupted Fetal Diffusion MRI
- StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description
- WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching
- From Minimal Clinical Prompts to 3D: Spacing-Aware Prompt Propagation for Multimodal Prostate Lesion Segmentation in bpMRI
- Weight Feedback Computes the Exact Jacobian Transpose in Modern Deep Networks
- TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis
- Reconstructing Dense Depth of Dark Scenes with Sparse LiDAR, Noisy Events, and Blurry RGB
- Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion
- When the Teacher Has More Bits: Self-Teacher Latent Distillation for Learned Image Compression
- Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
- Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning
- Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning
- SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations
- UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models
- 340 FPS Reflection-free Video from Spikes Modulated by a Rapidly Rotating Polarizer
- Beyond Script Family Boundaries: Towards Unified Open-Set Scene Text Recognition
- Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation
- Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds
- AlphaRad: Grounded Zero-Shot Classification in Chest Radiology via α-Corrected Binary Cross Entropy and Factorized Latent Supervision
- MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization
- Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
- ProAct: Agentic Lookahead in Interactive Environments
- Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset
- Video-Oasis: Rethinking Evaluation of Video Understanding
- Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
- Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence
- Spectral Gradient Orthogonalization Improves Differentially Private Training at Scale
- Infinite Gaze Generation for Videos with Autoregressive Diffusion
- Revisiting the Volumetric Data of 4DME: Compression, Extension and Benchmarking for Micro-Expression Analysis
- Auto3R: Automated 3D Reconstruction and Scanning via Data-driven Uncertainty Quantification
- A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models
- AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors
- Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
- Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability
- UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation
- Prosthesis-Aware 3D Human Pose Estimation: A Dataset and Benchmark for RSP Users
- MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins
- Tesselating The Earth
- Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers
- PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur
- CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation
- Sim, Yet Same: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds
- EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder
- A Dual-Transformer Architecture with Cross-Attention for Multi-Camera View Recommendation
- PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling
- Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models
- RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation
- SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation
- SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark
- AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware
- Controlling Motion Transfer in Diffusion Transformers via Attention Heads
- InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion
- MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
- Attention is Case-Sensitive
- 3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement
- Predictive Structure Improves Video Diffusion Dynamics
- Fabric Image Demoiréing Benchmark from Synthesis to Restoration
- VectorReLoc: Reliable Vectorized SD Map Visual Re-localization with Contrastive Feature Alignment
- Meric: A Unified Framework for Multimodal Music Generation and Retrieval via Representation Space Anchoring
- Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
- IoUCert: Robustness Verification for Anchor-based Object Detectors
- From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs
- ActionParty: Multi-Subject Action Binding in Generative Video Games
- VERTIGO: Visual Preference Optimization for Cinematic Camera Generation
- What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility
- VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations
- WorldCache: Content-Aware Caching for Accelerated Video World Models
- MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
- DynEval: Holistic Evaluations of T2I Generative Models in the Wild
- What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
- Narrative-Driven Paper-to-Slide Generation via ArcDeck
- VOID: Video Object and Interaction Deletion
- WildProp: Visual Estimation of Wildlife Body Proportions at Scale
- Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
- MotionEditGS: Editing Motion and Appearance of 4D Scenes from Monocular Video via Semantically Anchored Gaussians
- Equivariant Symmetry-Aware Head Pose Estimation for Fetal MRI
- StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation
- SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models
- StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
- TACO-Net: Topological Signatures Triumph in 3D Object Classification
- Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
- Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers
- Unified and Efficient Point-Line Local Features
- AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision
- SafeSAE-VLA: Interpreting OpenVLA Progress Dynamics with Sparse Feature Analysis
- YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation
- SyncVL: Synchronizing Vision ⟷ Language Using Unsupervised Adaptation
- When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression
- Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation
- ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling
- Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion
- Multi-Head Normalization for Wide Vision Transformers
- Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
- Schroedinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics
- LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
- Learning Generatable Mutual Distance for Scene-Aware Human Motion Generation
- LOOM: Weaving Geometry-Consistent Human-Object Interaction Videos via Progressive Curriculum Learning
- Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints
- StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
- ReflectCAP: Detailed Image Captioning with Reflective Memory
- SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks
- Articulated Object Reconstruction from Rest-State Observation
- PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection
- Head Avatars with Dynamic Explicit Hair
- DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation
- Diffusion-Based Immersive Visual Reasoning
- VisTa3D: A Dataset and Benchmark for Vision, Tactile, and 3D Point Clouds-based Thin Object Reconstruction
- Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- PrimitiveUDF: Primitive-Based Unsigned Distance Fields for Surface Reconstruction from Point Clouds
- Generative Relightable Avatars
- GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth
- SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers
- One Video, One World: Turning Monocular Video into Physical 4D Scenes
- CL4D: Contrastive Language–4D Pretraining for Vision-Language Reasoning in Dynamic Scenes
- MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources
- Event-driven Motion Deblurring via Trajectory-based Kernel Reconstruction
- Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose
- PhysConvex: Physics-Informed Dynamic Convex Fields for Reconstruction and Simulation
- SplatCtrlA: Generalizable Single Image to Fully Controllable 3D Avatar
- SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation
- Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
- BrepLLM: Enabling Large Language Models to Understand Boundary Representations
- DriftScope: Measuring The Hidden Effects of Diffusion Model Fine-Tuning
- Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps
- InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics
- Reconstruction by Generation: 3D Multi-Object Scene Reconstruction from Sparse Observations
- TimeWalker: Personalized Neural Space for Lifelong Head Avatars
- ECHO: Ego-centric Modeling of Human-Object Interactions
- Video Generation Models are General-Purpose Vision Learners
- UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
- WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation
- VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
- HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation
- Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints
- Roam2Room: A Unified Floorplan-to-Furnished Framework for Controllable Indoor Scene Generation
- EmoteGPT: 3D Human Facial Expression from Natural Language Descriptions
- Rethinking Detection Calibration: A Coordinate Perspective
- PASDiff: Physics-Aware Semantic Guidance for Joint Real-world Low-Light Face Enhancement and Restoration
- OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras
- ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering
- HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching
- HiChor: Hierarchical Choreography Generation from Pop Music with Choreographic Primitives
- LaVPR: Benchmarking Language and Vision for Place Recognition
- LoCA: Spatially-Aware Low-Rank Convolutional Adaptation of Vision Foundation Models
- PolyLayout: Multi-room Manhattan Layout Estimation
- What Moves? Localized Motion Representations for Compositional Scene Control
- PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
- Following Motion for Sequential Modeling in Video Frame Interpolation
- Task Alignment: A simple and effective proxy for model merging in computer vision
- Estimating Velocity and Spin of Spherical Objects from Rolling-Shutter Image(s)
- Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots
- Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion
- OmniColor: A Unified Framework for Multi-modal Lineart Colorization
- 4D-VGGT: A SpatioTemporal Foundation Model for Dynamic Scene Geometry Estimation
- World Knowledge in the Weights: Reading Concept Circuits of Vision Transformers
- Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation
- SGMatch: Semantic-Guided Non-Rigid Shape Matching with Flow Regularization
- Tuning-free Visual Effect Transfer across Videos
- MorphGS: Morphology-Adaptive Articulated Motion Transfer from Videos
- MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes
- Activation Quantization of Vision Encoders Needs Prefixing Registers
- ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
- HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion
- InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation
- Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
- Test-Time Registers as Global Priors for Tokenized Image Generation
- XSurfer: Reconstructing surface meshes of cerebral and cerebellar cortex from diverse MRI data using untrained neural networks
- Monocular Models are Strong Learners for Multi-View Human Mesh Recovery
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- Grounding World Simulation Models in a Real-World Metropolis
- Analytic Bayesian Uncertainty for LiDAR Segmentation: A Single-pass Generative Approach
- Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras
- RADmesh: Remesh-Aware Mesh Deformation
- Seeing Fast and Slow: Learning the Flow of Time in Videos
- Rolling Shutter Camera Self-Calibration
- D-Rex : Diffusion Rendering for Relightable Expressive Avatars
- SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset
- AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images
- Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow
- Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features
- BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
- Geometry-Preserving Image Generation for 6D Object Pose Estimation
- Towards Real-World Wearable Motion Reconstruction
- Unsupervised Semantic Segmentation Facilitates Model Understanding
- OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection
- Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
- UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors
- Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
- MLVC: A Multi-platform Learned Video Codec for Real-World Deployment
- Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
- Plug-and-Play Attention Linearization for Pretrained Transformers
- JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video
- Mitigating Radar-Inertial Calibration Ambiguities via SO(3) Manifold Steering
- Variational Patch Gating for Training-Free Few-Shot Classification
- PoseImageNet: Pose Estimation for Extensive Classes Based on Rich Structure Prototypes
- Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Generation
- Kilometer-Vision: A New Frontier for Large-Scale Spatial Awareness in VLMs
- Trajectory-aware Cross-view Geo-Localization with Sequential Observations
- TriMotion: Modality-Agnostic Camera Control for Video Generation
- On the real-world generalisability of Optical Flow models
- GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
- ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
- UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Driving
- Beyond Inpainting: Unleash 3D Understanding for Stable Camera-Controlled Video Re-rendering
- GraphVid: Interactive Graph-Controllable Video Generation
- Verifying Cancer Segmentation in Vision Transformers via Internal Concepts
- ARMS: Anchor–Relational Motion Streaming for Seamless Solo-Social Motion Transitions
- Enlightening Photographic Style Transfer with a Self-Supervised Photographic Embedding
- Pix2NPHM: Learning to Regress NPHM Reconstructions From a Single Image
- REON-NVS: Real-Time Online Novel-View Synthesis from Sparse-View Videos
- Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs
- GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models
- Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision
- StreetForward: Perceiving Dynamic Street with Feedforward Causal Dynamics
- General Self-Calibration with Varying Intrinsics
- Hyperbolic Hierarchical Clustering for Visual Representation Learning
- CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
- MuCHeR: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking
- VideoSfM: Exploiting Temporal Structure for Video-Based Structure-from-Motion
- Social-Mamba: Socially-Aware Trajectory Forecasting with State-Space Models
- SignRefine: Adapting Foundational Video Models for Sign Language Generation
- CameraAnything: Refilming Videos with Arbitrary Camera Control
- ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video
- Delaunay Canopy: Building Wireframe Reconstruction from Airborne LiDAR Point Clouds via Delaunay Graph
- Ray-Path-Aware Virtual Point Removal on 2D Layer-Wise Nearest Point Map
- TAQ: Static-Deployable Temporal-Aware Quantization for Real-World Video Super-Resolution
- MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training
- E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects
- Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
- SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data
- Invisible Shortcuts: Why Vision Encoders Know Your Camera
- SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery
- Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation
- GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion
- InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars
- MMDiff: Extending Diffusion Transformers for Multi-Modal Generation
- Mechanistic interventions for explainable digital pathology uncovers adversarial vulnerabilities
- MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
- Long-term Traffic Simulation via Structured Autoregressive Modeling
- ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
- Multi-Modal Controlled Coherent Motion Generation
- OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos
- DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies
- BLOB-Q: Boosting Low Bit ViT Quantization via Global Optimization on Model Distortion
- DnA: Denoising Attention for Visual Tasks
- RoMa v2: Harder Better Faster Denser Feature Matching
- Reconstructing Humans and Objects in Interaction using Large Reconstruction Models
- Detect by Track: Making Detector-Free Matcher Trackable
- WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation
- Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
- FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model
- 3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism
- OmniPoser: Flexible Human Motion Recovery in the Wild with Masked Flow Matching
- TIDES: Time-Derivative Event Simulation via Deformable Reconstruction
- FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion
- GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images
- StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics
- Dense Dynamic Scene Reconstruction and Camera Pose Estimation from Multi-View Videos
- Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
- ARGENT: Adaptive Hierarchical Image-Text Representations
- OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
- AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak Labels
- FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
- Syn4D: A Multiview Synthetic 4D Dataset
- PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided VLM
- Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction
- ID-PreFeR: ID-Preserving Face Restoration with Mixed Data Quality
- Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
- Music-to-Dance Generation via Atomic Movements
- Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting
- Ego-Human Motion Prediction with 3D-Aware LLM
- IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video
- MoBa-GS: Learning a Spatially-Varying Motion Basis over a Dynamic Canonical Space for 4D Reconstruction
- PhysPO: Physics-Aware Local Preference Optimization for Physically Consistent Video Diffusion
- Category-Level 3D Correspondence in Camera Space via Morphable Object Priors
- Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Synthesis
- CustomX: Unified Character, Action, and Scene Customization in Video World Models
- Moiré Video Authentication: A Physical Signature Against AI Video Generation
- Human-like Object Grouping in Self-supervised Vision Transformers
- Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
- Versatile Editing of Video Content, Actions, and Dynamics without Training
- Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation
- Moving Beyond More Views: Redundancy-Aware Ego–Exo Fusion for Proficiency Estimation
- IC-World: In-Context Generation for Shared World Modeling
- Quick ViTs: Speeding up Vision Transformers through Equivariance
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Synthetic Data
- VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation
- EMOTE: Expressive Motion and Shape Disentanglement for Human Animation
- ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
- DisentangledTMR: Privacy-Preserving Skeleton Motion Retargeting via Factorized Transformers
- Honey, I Shrunk the Arc de Triomphe!
- Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding
- SPARC: Scalable Path-Specific Counterfactual Fairness via Causal Conditional Independence
- ComplexMimic: Human–Scene Interaction Imitation in Complex 3D Environments
- Boosting Correspondence Learning with Structure-Aware Estimator
- TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation
- Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond
- Lightweight Online Reinforcement Learning for Block Decomposition of CAD Models
- Egocentric World Model for Photorealistic Hand Object Interaction Synthesis
- Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
- Discovering Geometric Biases in 3D Face Reconstruction: A Curvature-Aware Spectral Framework for Fairness Evaluation
- Training-free Controllable Motion Generation under Heterogeneous Constraints
- Human Mesh Modeling for Anny Body
- PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
- Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
- In-Context Sync-LoRA for Portrait Video Editing
- GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
- MASS: Motion-Aligned Selective Scan for Flow-Based Video Frame Interpolation
- InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image
- LoMa: Local Feature Matching Revisited
- Rolling Shutter Relative Pose Estimation Made Practical
- Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings
- EgoMAN: Interaction-Structured Reasoning for Egocentric 3D Hand Trajectory Prediction
- HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
- 4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video
- OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization
- EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
- Fast Sam 3D Body: Accelerating SAM 3D Body for Real-Time Full-Body Human Mesh Recovery
- Axolotl3D: a Unified Framework for Faithful 3D Shape Completion
- ObjectForesight: Predicting 3D Object Trajectories from Human Videos
- Leaving the City: A Large-Scale Aerial Dataset for Cross-Season Localization in Unstructured Environments
- JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation
- Sparsity-Inducing Divergence Losses for Biometric Verification
- EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
- OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer
- Frozen CLIP Priors for Robust Self-Supervised Poisson Inverse Problems
- SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
- Sequential Visual Place Recognition: Exploiting Trajectory Priors for Robust Localization
- EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis
- Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation
- Make Geometry Matter for Spatial Reasoning
- Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
- MotionSplicer: Part-Based Motion Editing for 4D Volumetric Videos
- Boosting 3D Foundation Models with Featureless Pose Optimization
- SemGAN: A Semantic and Hierarchical Adversarial Network for 3D Human Pose Estimation
- Towards Reconfigurable Visual Feature Compression
- Recognizing Co-Speech Gestures in-the-Wild
- Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification
- Face Anything: 4D Face Reconstruction from Any Image Sequence
- Self-supervised Garment Dynamics with Persistent Wrinkles
- EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices
- MuSViT: A Foundation Vision Model for Sheet Music Representation
- Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation
- CS-TTA: Preserving Concept Sensitivity in Test-Time Adaptation
- ICLAgent: Integrated Circuit Footprint Geometry Labeling via LMM-empowered Multi-Agent Framework
- NEOMAP: Novel-View Synthesis via Noise Initialization by Manifold Alternating Projection
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
- Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation
- AutoPhyX: Automatic Text-Condition Physics Property Generation
- CLIMP: Contrastive Language-Image Mamba Pretraining
- TaskTok: Delving into Task Tokens for Task-driven Image Restoration
- MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
- LivingWorld: Interactive 4D World Generation with Environmental Dynamics
- EgoSim: Egocentric World Simulator for Embodiment Interaction Generation
- FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Arbitrary Images
- SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning
- ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation
- InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization
- RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration
- CAST3D: Customizing Arbitrary 2D Assets into 3D World
- SynHMR: Synergistic Joint-Mesh Modeling for LiDAR-based Human Mesh Reconstruction
- FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility
- Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds
- LibraGen: Playing a Balance Game in Subject-Driven Video Generation
- From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion
- On Locality and Length-Generalization in Visual Reasoning
- PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models
- STANCE: Controllable Video Generation for Structured Dynamics via Sparse-To-dense ANChored Encoding
- Visible Yet Unrecognizable: Frequency-Selective Facial Privacy via Attention
- BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal
- Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?
- 360Anything: Geometry-Free Lifting of Images and Videos to 360°
- SA-V2V: Training-Free Subject-Aware Video-to-Video Personalization
- PHOSA: Photorealistic 3D Sign Avatar Modeling and Benchmark
- DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models
- CAR-MIL: Counterfactual Attention Regularization for Multiple Instance Learning
- InnoText: A Unified Model for Visual Text Generation and Editing
- M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection
- Decoding Children’s Gait Behavior
- CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation
- InclusiveHuman-10K: Towards Inclusive Human Parsing Beyond the Intact-Limb Assumption
- PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation
- Kinematics-Agnostic 3D Human Motion Prediction via Equivariant Latent Diffusion
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
- EDM:Event-guided Diffusion Model for Video Shadow Detection in Complex Dynamic Scenes
- NumColor: Precise Numeric Color Control in Text-to-Image Generation
- Streaming Dense Voxel Representations for 3D Occupancy Prediction
- Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models
- VGEdit: Unlocking Video Generation Priors for Reasoning-Informed Image Editing
- MoScale: Autoregressive Next-Scale Prediction for Human Motion Generation and Editing
- Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection
- Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer
- Region-Aware Multimodal Interleaving for Animal Re-Identification
- Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation
- Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
- MANGO: Unleashing Image Generation Capability of Unified Multimodal Models
- SGQA: Semantic-Geometric Quality Alignment for Training-Free Few-Shot Instance Segmentation
- Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
- Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting
- Complex-Valued 2D Gaussian Representation for Computer-Generated Holography
- Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline
- Fast Dynamic Prototypes for Unsupervised Anomaly Detection and Localization
- LISA: Locality-Informed Speculative Decoding for Accelerating Autoregressive Image Generation
- Free‑CD: Probabilistically Decoupled Training-Free Open-Vocabulary Change Detection with Resolution-Invariant Feature Inversion
- RiO-DETR: DETR for Real-time Oriented Object Detection
- QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification
- Revisiting Avatar-As-Image: High-Fidelity Registration is All You Need
- Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling
- Diffusion-Based Material Regularization for Physics-Based Inverse Rendering
- UNet-Twice: A Simple Structured Reference-based Inpainting Framework
- SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- MapDreamer: Aerial Imagery Conditioned Latent Diffusion For Lane Level Map Generation
- Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search
- ReSWD: ReSTIR‘d, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction.
- STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection
- Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions
- ShellMaker: Language-Guided Exterior Completion under Structural Constraints
- FoundYou: A Unified Model for Personalized Segmentation and Retrieval
- DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models
- LensStyle: Learning the Optical Aesthetics for Controllable Stylized Lens Effect Rendering
- TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution
- Back-Tracking from Clarity: Self-Learning to See Text from Afar
- In-context Region-based Drag: Drag Any Region to Any Shape
- RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation
- AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
- DiffPro: Joint Timestep and Layer-Wise Precision Optimization for Efficient Diffusion Inference
- Text-Conditioned Background Generation for Editable Multi-Layer Documents
- EVAR: Edge Visual Autoregressive Models via Principled Pruning
- High-Throughput Event-Based Feature Detection and Tracking on an Embedded CPU
- MiNQVIS: Mitigating Noisy Queries for Robust Online Video Instance Segmentation
- Multi-dimensional Preference Alignment by Conditioning Reward Itself
- HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching
- Heat Kernel Textures -- the Geodesic Gaussians That Do Not Splat
- PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking
- Granular Semantic Cognition for Visible-Infrared Person Re-Identification
- Bridging Online and Offline Handwriting via Differentiable Physical Rendering
- A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention
- VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion
- Bottom-up modeling of repeated elements via single image analysis-by-synthesis
- DRPO: Disentangling Demographic Bias from Rewards for Fair Diffusion Alignment
- Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization
- EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis
- NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation
- FPicker: Topology-Guided Evolution for Filament Tracing in Low-SNR Microscopy
- FontCopilot: Towards Generalist Multimodal Large Language Models for Holistic Chinese Font Engineering
- Uncertainty-aware tree height change regression
- Training-Free Multi-Concept Image Editing
- DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing
- Q-REAL: Towards Naturalness and Distortion Evaluation for AI-Generated Content
- Entropy-Controlled Flow Matching
- Triangular Consistency as a Universal Constraint for Learning Optical Flow
- SceneDiff: A Benchmark and Method for Multiview Object Change Detection
- SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation
- RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models
- NUN: Nested Unfolding Network for Real-World Concealed Object Segmentation
- GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models
- NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment
- HuCollisionField: Resolving Self-Collisions via Neural Fields for Human Prediction
- Silhouette-based Gait Foundation Model
- LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
- Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
- ELHINN: Unifying Dense Crowd Simulation Across Scales via Eulerian–Lagrangian Hydrodynamics
- FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs
- Multi-View Foundation Models
- YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Reasoning
- AV2T-Gen: Aerial Visible to Thermal Generation with Environment and Vehicle State Guidance
- ThermoGS: Decoupling Physical Surface Attributes for Spatio-Temporal Thermal Field Emulation via 4D Gaussian Splatting
- CountEx: Fine-Grained Counting via Exemplars and Exclusion
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
- TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On
- SAEdit: Token-Level Control for Continuous Image Editing via Sparse Autoencoder
- Attribute Token Arithmetic: Disentangled and Continuous Semantic Control for Visual Autoregressive Models
- Sound-based Multi-Person 3D Pose Estimation
- PointSplat: Compact Gaussian Splatting via Human-Centric Prediction
- MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
- Revisiting Autoregressive Models for Generative Image Classification
- Push–Pull Attentional Anchoring for Diffusion Concept Erasure
- Where and What: Long-Term Object Tracking in Egocentric Videos
- DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion
- FitControler: Toward Fit-Aware Virtual Try-On
- Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion
- Controlling Embedding Spaces with Text-Conditioned Transformations
- LoGAN: Multilingual Font Localization with Generative Agents
- ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
- EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
- Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
- APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise
- Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
- GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking
- UniTranslator: A Unified Multi-modal framework for End-to-end In-Image Machine Translation
- WebEyeTrack: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization
- DuoFlow: JVP-Free Finite-Difference Mean Flows for One-Step Image Generation
- EVEE: Event-Based Online Adaptation for Matching on Unknown Targets
- Layering Virtual Try-On
- TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation
- PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design
- TopoFuse: Topology-Aware Tri-Planar Fusion for 3D Cryo-Electron Tomography Segmentation
- Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation
- RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- Policy-Based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards
- Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
- NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics
- Spanning the Visual Analogy Space with a Weight Basis of LoRAs
- Spanning Tree Autoregressive Visual Generation
- HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models
- POET: Preference Optimization for Enhanced Text-to-Image Generation
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- TOPA: Mitigating Concept Dominance in Diffusion Personalization via Target-Oriented Perturbation Augmentation
- Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration
- Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality
- Single-Query Person-Centric Bimanual Hand-Object Interaction Detection
- Reinforcement Learning for Multimodal Diffusion Language Models via Bidimensional Trajectory and Thought Optimization
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- Teaching an Agent to Sketch One Part at a Time
- DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
- FusionTrack: Collaborative Multi-Object Tracking with Arbitrary Multi-UAVs
- Environmental Change Detection for Real-World Change Analysis
- Personalized Reward Modeling for Text-to-Image Generation
- SplitHDR: Saturation-Aware HDR Recovery and Denoising for Real-Time Detection
- Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution
- Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
- Disentangling Rotation and Translation from SE(3)-Equivariant Features for Shape Assembly
- DOGE: Differentiable Bézier Graph Optimization for Road Network Extraction
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising
- Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction
- Unmasking-Time Visual Calibration for Hallucination Mitigation in Multimodal Discrete Diffusion Language Models
- Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes
- DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
- Pathryoshka: Compressing Pathology Foundation Models via Multi-Teacher Knowledge Distillation with Nested Embeddings
- REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion
- Unsupervised Source-Free Ranking of Biomedical Segmentation Models Under Distribution Shift
- MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes
- P3-SAM: Native 3D Part Segmentation
- Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention
- LayerVerse: Finding the Sweet Spot for KV-Injection in Training-Free Image Editing
- TerraDiT-Ω: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
- LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents
- Per‑Object IoU Forecasting for Deadline‑Aware Real‑Time Embedded Detection Control
- STAT: Soft Tail-dropping for Adaptive Visual Tokenization
- Compositional Non-Face Re-Identification Pressure under Cumulative Vision Releases
- FairSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
- Posterior Augmented Flow Matching
- Unsafe by Reciprocity: How Generation–Understanding Coupling Undermines Safety in Unified Multimodal Models
- Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images
- WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment
- TiCRL: Textual Image Classification with Reinforcement Learning-Based Curriculum Learning
- TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects
- Target-aware Image Editing via Cycle-consistent Constraints
- Temporally Stable Generative Illumination with a One-Step Diffusion Model
- FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
- Slim-DETR: Real-Time Tiny Object Detection with Efficient Interaction and Gaussian Query
- Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning
- Learning Video Dynamics with Predictive Differentiable Rendering
- SpecV: Specification Verification for Robust Unified Multimodal Evaluation
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- CGCE: Classifier-Guided Concept Erasure in Generative Models
- PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates
- DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection
- Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation
- Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
- DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection
- CLUE-VAD: Structured Semantic Clues for Understanding Explainable Events in Video Anomaly Detection
- URHead: A Unified UV-Space Representation for Joint Mesh–3DGS Optimization in Head Avatars
- ODONet: Online Dynamic Offset Network for Visual Object Tracking
- Hybrid-LUT: Channel-Aware Hybrid Lookup Table and Filtering for Efficient Image Restoration
- BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure
- MCVL: Multi-Space Cross-View Learning for Aerial-Ground Person Re-Identification
- Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
- Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows
- UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset
- WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion
- Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
- OCTA-SOT: Online Cross-Modal Trajectory Adjustment for RGBT Anti-UAV Single Object Tracking under Spatio-Temporal Misalignment
- Event Stream-based Sign Language Translation: A High-Definition Benchmark Dataset and A Novel Baseline
- MATCH: Flow Matching for Multi-View Anomaly Detection
- Evidence Triangulation for Multimodal Fact-Checking in the Wild
- Reinforcing Video Reasoning with Focused Thinking
- Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting
- GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
- Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback
- Constrained Rotation Optimization: Revisiting Crop-Based Gaze Estimation
- DualCount: Structurally Consistent Density and Point Modeling for Zero-Shot Object Counting
- Obliviate: Erasing Concepts from Autoregressive Image Generation Models
- Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold
- Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
- Proximity-CLIP: Text-Guided Semantic Proximity Learning for Zero-Shot Anomaly Detection
- SAM2Matting: Generalized Image and Video Matting
- Learning Geometry-Aware Embedding Fields for Intrinsic Riemannian Mappings
- Reflecting Process Expertise in Procedural Material Generation
- Real-Time Source-Free Object Detection
- DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes
- Harnessing SSL for Segmentation in 3D Microscopy with Noisy Labels and Hard Patches
- DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
- Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection
- Seeing as Humans Do: Learning from Motion to Segment Anything Without Supervision
- LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
- PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
- Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing
- Correlation-Weighted Multi-Reward Optimization for Compositional Generation
- Rethinking Robust Adversarial Concept Erasure in Diffusion Models
- Text-based Tactile Graphics Generation for the Visually Impaired
- FuDU: A Fuzzy Dual-dimension Uncertainty Framework for Streaming Active Learning in Industrial Defect Detection
- InstanceControl: Controllable Complex Image Generation without Instance Labeling
- StereoEdit: A Diffusion-Based Framework for Stereo-Consistent Image Editing
- Online 3D Instance Segmentation at task-oriented granularity with Unposed Monocular Video
- AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
- Mode-Conditioned Residual Calibration for Multi-Object Tracking
- Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization
- HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy
- OSVE: One Step Video Editing with One Step Diffusion Models
- Benchmarking MLLMs on Mistake Recognition and Explanation in Single-Step Components of Cooking
- CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning
- Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
- A Scalable Vector Graphics Latent Space
- TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers
- PhenoLeaf-TS: A Time-Series Benchmark for Leaf Instance Segmentation, Tracking, and Growth Stage Classification
- Repurposing Geometric Foundation Models for Multi-view Diffusion
- Local Spacing-Aware Hungarian Matching for Stable Point-Supervised Crowd Counting
- TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields
- A Comprehensive Analysis about Unsupervised Outlier Detection for Images
- On-Orbit Real-Time Wildfire Detection Under On-Board Constraints
- Zero-Shot Image Personalization from Personas
- A Simple Baseline with Placement Prior for Point-Supervised Oriented Object Detection
- Bridging the Geometry Mismatch: Frequency-Aware Anisotropic Serialization for Thin-Structure SSMs
- AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
- Optimization-Guided Diffusion for Interactive Scene Generation
- ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation
- ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection
- SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors
- 3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification
- Through Van Gogh’s Eyes: Global Style Transfer with Diffusion Model
- HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models
- Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors
- h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform
- Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels
- Reference-Free Quality Assessment for Virtual Try-On via Human Feedback
- COLA: Continual Orthogonal Low-Rank Adaptation for Class-Incremental Learning
- CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning
- BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
- NearID: Identity Representation Learning via Near-identity Distractors
- SCALE: Semantic-Calibrated Guidance Enhancement for Prompt-Faithful Diffusion
- Vector Scaffolding: Inter-Scale Orchestration for Differentiable Image Vectorization
- Generalization and Memorization in Rectified Flow
- Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
- ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation
- Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
- V-HOLD: Stabilizing Flow Trajectories to Rethink the Edit–Preservation Trade-off
- When Rubrics Fail: Error Enumeration as Reward for Reference-Free RL Post-Training
- LumiTokens: 3D Relighting via Token-Space Lighting Transformation
- Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation
- Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
- Rapidly Deploying On-Device Eye Tracking by Distilling Visual Foundation Models
- CHARTSTYLE-100K: A Large-Scale Dataset for Structured Visualization Style Transfer
- Consistent Feature Transport for Image Relighting
- SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation
- Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models
- SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
- Improved Immiscible Diffusion: Accelerating Diffusion Training by Reducing Miscibility
- UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
- Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
- Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness
- PRISM: Latent Composition Consistency for Single-Image Reflection Removal
- DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation
- CRD-Net: Frequency-Adaptive Feature Injection and Change Decoupling for Building Damage Assessment
- H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks
- Don’t Starve the Boundaries: Boundary-Constrained Label Propagation for Weakly Supervised 3D Segmentation
- Self-Improving Diffusion Classifiers with Minority Preference Optimization
- EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
- Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing
- DARL: Efficient Document-to-Markup Generation via Look-Ahead Diffusion Trajectory Sampling
- Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
- Continuous Speculative Decoding for Autoregressive Image Generation
- SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
- Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection
- WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
- Editing Everything Everywhere All at Once
- Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games
- K-Mask: Kinematic-Aware Masked Modeling for Controllable Text-to-Motion Synthesis
- OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations
- ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
- Robust 3DGS-based SLAM via Adaptive Kernel Smoothing
- Semantically Aligned Gradient-Driven Context-Preserving Image Editing
- IACD: Iterative Adversarial Collaborative Detection via Dual-Perspective Blind Spot Discovery
- VIGA: View-Conditioned and Identity-Guided Adaptation for Aerial-Ground Person Re-Identification
- Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns
- Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers
- TiltDiff: Tilted Weight-Space Diffusion for Neural Network Generation
- RCEdit-500K: Reference Completion for Image-Conditioned Image Editing
- VLTR: Vision-Language Tool Reasoning for Instruction-Guided Image Editing
- ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs
- Why Linear Probing Works: Non-Vacuous Generalization Bounds via Effective Dimension
- CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization
- NeuralGarSim: Geometry-agnostic Garment Simulation with Neural Fields
- To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
- The Map Is Not the Territory: Embedding-Coverage Blacklists for Safe Diffusion Steering
- Segmentation-Guided Homography Estimation for Long-Term Planar Tracking
- ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling
- DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints
- ReTarget: Representation Transformation via Adversarial Regularization for Geometric Misalignment
- Prototype Normalization: Optimizing Prototype Separation for Heterogeneous Federated Learning
- CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery
- ProSR: Semantic-Prototype-Guided Discrete Modeling for Physically Consistent SAR Super-Resolution
- CaRe: Critical Parameter Rectification for Efficient Visual Modeling
- AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
- HER-Count: Learning Hyper-Exemplar Representation for Generalized Zero-Shot Object Counting
- FST-SAM3: Taming SAM~3 with Frequency-Spatio-Temporal Refinement for Video Polyp Segmentation
- An Inverse-Adversarial and Difficulty-Adaptive Robust Vision-Language Model
- R2M: Real-Aware Residual Model Merging for Robust and Generalizable Deepfake Detection
- Straight-Path Flow Matching for Incomplete Multi-View Clustering
- Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection
- Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models
- D2PO: Optimizing Diffusion Samplers via Dynamic Preference
- SFM: Taming State Space Models for Text-to-Motion via Spatial-Frequency Modeling
- BATQuant: Outlier-Resilient MXFP4 Quantization via Learnable Block-wise Optimization
- AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation
- ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching
- MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation
- Spectral Prior for Reducing Exposure Bias in Diffusion Models
- FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small-Object Detection
- BEVOpen3D: Towards Open-World 3D Object Detection in Bird's-Eye-View
- D3F-IR: Dual-Domain Deterministic Flow Matching for Visible-to-Infrared Translation
- Revisiting Deepfake Detection: BCNet for Robust Generalization Beyond Semantic Dependence
- BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
- REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling
- Contrastive Conditional–Unconditional Alignment for Long-tailed Diffusion Model
- Virtual Category-Guided Continual Generalized Category Discovery
- CaPCL: Caption-Preserved Continual Learning for Text-to-Image Retrieval
- Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking
- Label-Free Text Prototype Adaptation for Open Vocabulary Segmentation
- Solving Diffusion Inverse Problems with Restart Posterior Sampling
- Unified Multi-plane Autoregressive Diffusion for 3D Multi-Contrast MRI Synthesis
- Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy
- Y-diff: Structure-Texture Decoupled Diffusion Distillation for H&E-to-pCLE Translation
- DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation
- Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models
- Rethinking Cross-Spectral Image Generation via Shared-Specific Representation
- SCoT: Similarity-guided Conflict-aware Task Consolidation for Continual VQA
- HEM: a margin-based loss for visual categorisation tasks
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- CMDer: Controllable Mode Decomposition-Based Single Motion Synthesis with Diffusion
- Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving
- COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning
- DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent
- Fisher-Routed Mixture of Experts for Federated Class-Incremental Learning
- CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
- Mask-guided Semantic Alignment: Robust Learning with Noisy Labels via Temporal Attention Stability
- Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation
- Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment
- Aligning Anything: Hierarchical Motion Estimation for Video Frame Interpolation
- Degradation-Robust and Temporally Consistent Infrared–Visible Video Fusion via One-step Diffusion Framework
- Semantic Browsing: Controllable Diversity for Image Generation
- KATANA: Knowledge-Aligned Topology-Aware Neural Agents for RL-Driven Vision-Language Model Compression
- Breaking Rigidity in Adversarial Patch Attacks
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
- Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
- SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation
- Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
- Cross-Resolution Distribution Matching for Diffusion Distillation
- ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding
- Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition
- RhymeFlow: Training Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling
- SLAIR: Structured Latent Flow Matching for All-in-One Image Restoration
- VD-LoRA: Adaptive Reuse of Low-Rank Directions for Continual Learning
- Disentangling and Reusing Interaction Cues for Zero-Shot HOI Detection
- Why Feature Magnitude Deceives OOD Detectors: An Angular Separation Perspective
- Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension
- DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents
- FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity
- MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction
- Towards Sparsely Annotated Open World Object Detection
- SUM: Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors for Federated Class Incremental Learning
- SegPAR: Class-Centric Decision-Based Sparse Attack for Semantic Segmentation
- Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration
- Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
- Rank-Aware Hyperbolic Alignment for Vision–Language Dataset Distillation
- Training-Free Task Classification for Multi-Task Model Merging
- MED-LCDS: Multi-Expert-Domain CLIP Classification via Logit Calibration
- FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring
- MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation
- FaceMoE: Mixture of Experts for Low-Resolution Face Recognition
- LANCE: Low Rank Activation Compression for Efficient On-Device Continual Learning
- TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction
- The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning
- Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation
- OP3DSG: Open-vocabulary Part-aware 3D Scene Graph Generation for Real-world Environments
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- From Local Geometry to Global Pseudo-Labeling for Robust Positive–Unlabeled Learning under Covariate Shift
- Prevention over Correction: Learning Aligned Representations in One-shot Federated Learning
- AnchorGUI: Asymmetric Memory for Dual-Scale Learning in GUI Navigation
- FedMental: Topology-Aware Federated Prototype Learning for Polymorphic Multimodal Psychiatry
- NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation
- Path-JEPA: Path Signature Based Predictive Learning for Skeleton Action Recognition
- Selective Synergistic Learning for Video Object-Centric Learning
- PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation
- Saber: Anchoring Semantics to Scale-Aware Kinetic Salience for Zero-Shot Skeleton Action Recognition
- Beyond Alignment: A Generative Matching Paradigm via Flow Matching for Zero-Shot Skeleton-Based Action Recognition
- Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation
- Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching
- Robust onion: Peeling Open Vocab Object Detectors Under Noise
- CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
- Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data
- Task-Agnostic Incremental Vision-Language Object Detection via Prompt Augmentation and Distribution-Aware Fusion
- Low-Rank Ternary Adaptation for Fine-Tuning Transformers
- Learning 1-Bit LiDAR-based Localization with Auxiliary Objective
- Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
- Diffusion-based dual-view reflection removal
- ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation
- Preserving Knowledge across Space and Time for Continual Video Deepfake Detection
- Beyond the Boundary: RL-Driven Solution Space Exploration for Blind Face Restoration
- Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges
- BIP: Bi-level Information Transfer and Completion Prompting for Visual Recognition with Missing Modalities
- Decoupling Complexity from Scale in Latent Diffusion Model
- BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models
- Wavelet-Driven Cross-Domain Consistency for Mixed-Supervised 3D Tumor Segmentation
- PriSM: Parsing and Style-Mixed Consistency for Unsupervised Domain Adaptation in Facial Landmark Detection
- Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew
- Co-evolving Representations in Joint Image-Feature Diffusion
- DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
- Region-Aware Test-Time Scaling for Compositional Image Generation
- TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger
- RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- Training-free Discriminative Patch Mining for Robust Few-Shot Recognition with CLIP
- Rethinking Adversary in Semantic Segmentation: An Out-of-Distribution Perspective
- VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection
- Spectral Consistent Flow for One-step 3D Medical Image Translation
- Stealthy Multi-task Adversarial Attacks
- SCDL: Synergistic Confidence-Dispersion Learning for Semi-Supervised Video Polyp Segmentation
- Towards Scalable Pre-training of Visual Tokenizers for Generation
- PASR: Pattern-Aware Scene-Conditioned Reasoning for Camouflaged Object Detection
- When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization
- μFlow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors
- Momentum Guidance: Plug-and-Play Guidance for Flow Models
- Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training
- Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation
- Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
- MoMCE: Mixture of Modality and Cue Experts for Multimodal Deception Detection
- Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels
- Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
- SAMPLe: A Sharpness Aware Minimization based Optimizer for Prompt Learning in Vision-Language Models
- RA-SOD: Reliability-Aware RGB-T Salient Object Detection under Modality Degradation
- CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
- Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models
- Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning
- Fragmented Text Is Insufficient for Image Representation: Fine-Grained Correspondence in Multimodal Dataset Distillation
- DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
- InfraNet: Quality-Aware RGB Guidance for Infrared Object Detection
- Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction
- Learning Accurate Segmentation Purely from Self-Supervision
- DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing
- Bayesian Uncertainty Attribution-Guided Fine-Tuning for Open-Set Action Recognition
- VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors
- LDC-MTL: Balancing Multi-Task Learning through Scalable Loss Discrepancy Control
- Enhancing prompt-image alignment evaluations via cyclic mutual information maximization
- Benchmarking Federated Learning & Knowledge Distillation for Point Cloud Classification
- When Specialists Meet Generalists: Segmenter-Coordinated Asymmetric Learning for Label-Deficient Concealed Object Segmentation
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
- Mitigating Pose–Scale Discrepancy Bias and Reforming Multi-Support Reasoning for Few-Shot Semantic Segmentation
- Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning
- Locality-Aware Continual Unlearning for Diffusion Models
- ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction
- Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning
- Online Versatile Incremental Learning: Towards Class and Domain-Agnostic Adaptation at Any Time
- Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
- DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning
- Safe Generalization: Mitigating Catastrophic Forgetting in Single-Source Multi-Organ Segmentation via Collaborative Causal Learning
- Short-to-Long Functional Connectivity Transfer via Structure-Aware Latent Diffusion
- RefAlign: Representation Alignment for Reference-to-Video Generation
- From Predictions to Embeddings: Dual Knowledge Distillation for Instance-Dependent Partial Label Learning
- ReynoldsFlow: Physics-Inspired Spatiotemporal Flow Representation for Video Understanding
- Physics Meets Perception: A Reinforcement Learning Framework for Unpaired Real-World Image Dehazing
- CRISP: Calibration-Aware Visual State Space Duality for Remote Sensing Image Segmentation
- RefDiT: Local Attribute Guidance in Reference-Based Image Generation
- Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations
- Exploiting Local Flatness for Efficient Out-of-Distribution Detection
- Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation
- Learning to Corrupt for Better Restoration
- FedDO: Dynamic Client Optimization for Adaptive Federated Learning
- DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation
- LACON: Training Text-to-Image Model from Uncurated Data
- Indelible Backdoors: On the Limits of Post-Training Defenses
- FD²: A Dedicated Framework for Fine-Grained Dataset Distillation
- XSemanticFlow: Cross Object Semantic Alignment for Zero-shot Manipulation
- Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection
- LUCE: Constrained Curve-Domain Guidance for Training-Free Low-Light Enhancement with Hue-Preserving Decoupling
- Improving Image-to-Image Translation via a Rectified Flow Reformulation
- From smooth to sharp: Frequency-Decoupled Latent Optimization for Realistic Image Generation
- Towards Unsupervised Multi-modal Semantic Segmentation
- MoE-KD: Your Teacher Model is Worth Mixture-of-Experts for Knowledge Distillation
- ELT: Elastic Looped Transformers for Visual Generation
- Intra-Class Consistency Guided Class-Agnostic Event Segmentation
- DA-F2F: Domain-Adaptive Object Detection with Feature-to-Feature Modulation and Alignment
- SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch‑Level Incoherence and Temporal Roughness
- OpenPanoD: Aligning Multimodal Prompts and Spherical Representations for Open-Vocabulary Panoramic Detection
- On the Vulnerability of Parameter-Level Defenses to Model Merging
- Residual-Guided Expert Specialization for Incomplete Multimodal Learning
- QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration
- Don’t Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance
- Data-Free Client Contribution Estimation via Logit Maximization for Federated Learning
- Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection
- Beyond Disjoint Tasks: Towards More Natural Continual Learning for Vision-Language Models
- HNDiff: Haze-Noise Diffusion for Image Dehazing
- UniStitch: Unifying Semantic and Geometric Features for Image Stitching
- PhysFlowNet: Learning Canonical Latent Manifolds via Spatio-Spectral Physics Priors for Underwater Object Detection
- When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators
- Generative Refinement Network for Visual Synthesis
- Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness
- CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection
- FSD-Net: Foundation-Guided Spatiotemporal Distillation for Video Polyp Segmentation
- Learning to Recover Task Experts from a Multi-Task Merged Model
- DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition
- Training-Free Refinement of Flow Matching with Divergence-based Sampling
- Attention-Logit Steering to Compositional Generalization for Continual VQA
- Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
- TerrainGraphNet: Terrain-Constrained Graph Reasoning for Landslide Segmentation
- Incentive Noise and Structural Prior Infusion for Multi-Modal Object Re-Identification
- LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
- Fourier Self-Supervision for Fine-Grained Generalized Category Discovery
- Distribution-Aware Feature Selection for Post-hoc Out-of-Distribution Detection
- TORA: Topological Representation Alignment for 3D Shape Assembly
- GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure
- H-SFP: Hierarchical Federated Learning with Decoupled Split-Model Prototyping
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
- SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation
- OPAL: Orthonormal Prototype Alignment Learning for Interpretable Image Classification
- Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers
- SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
- MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
- Stabilizing Ultra-Low-Bit Quantization of Multimodal LLMs via Global Bit Allocation
- Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
- MixCompress: Mixture of Experts for Variable Rate Learned Image Compression
- Capacity Overflow: A Blind Spot for Backdoor Attacks in Vision MoE
- Improving Adversarial Robustness via Activation Amplification and Attenuation
- Inference-Time Scaling of Diffusion Models via Progressive Pruning Search
- Defect-aware Hybrid Prompt Optimization for Zero-Shot Multi-type Anomaly Detection and Segmentation
- UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- Generative Manifold Distillation: Aligning Restoration Trajectories with the Natural Image Prior
- Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories
- Early Estimation of Language to Latent Alignment in Diffusion Models
- T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability
- TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization
- Shared LoRA Subspaces for almost Strict Continual Learning
- NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control
- Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation
- FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection
- Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis
- FedNASP: Federated Vision-Language Navigation with Adaptive Step-wise Personalization
- SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting
- S2-FracMix: Self-Saliency Fractal Mixup
- Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
- Prompt2Effect: Training-Free LoRA Synthesis for Controllable Video Effects
- Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama Generation
- MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment
- Diffusion Image Generation with Explicitly Modeling of Data Manifold Geometry
- Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models
- FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution
- Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation
- Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models
- Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection
- WaterGen: Decoupling Scene and Medium in Underwater Image Generation
- HVGCD:Rethinking Generalized Category Discovery through Hypothesis–Verification
- Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval
- MaterialFlow: Attribute-Disentangled Material Transfer via Trajectory-Aware Velocity Modulation
- Rethinking Real-World MRI Denoising: Learning from Physical Noise
- HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training
- Learning to Attract and Repel: Dual Quality Margin Learning for Face Recognition (DQM-Face)
- TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
- Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
- AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer
- RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation
- Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training
- Jumping the Landing Phase: Noise Variance Matching Enables Accurate Few-Step Inversion
- QASA: Quality-Guided K-Adaptive Slot Attention for Unsupervised Object-Centric Learning
- SAND: Stage-Aware Noise Decomposition for Training-Free Diffusion Guidance
- Diffusion to Obfuscation: Time-Adaptive Synthesized Generation Against Gradient Leakage Attacks in Federated Learning
- Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers
- Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
- ReliefSAM: A Geometry-Augmented Multi-Prior Adapter for Bas-Relief Segmentation
- TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings
- DiscoVL: Unveiling Disentangled Cross-Modal Representation Learning via Orthogonal Adversarial Regularization for Vision-Language Models
- Graph Coloring for Multi-Task Learning
- Reflection-Aware Reasoning for Non-Line-of-Sight Pedestrian Localization
- Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection
- Group3D: MLLM-Guided Semantic Grouping for Open-Vocabulary 3D Object Detection
- Hierarchical Prompt Injector for Domain Generalization Segmentation
- Rethinking Pseudo-Labels: Multi-Granularity Supervision for Domain Adaptive Object Detection
- One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
- DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
- Representation Alignment for Just Image Transformers is not Easier than You Think
- GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness
- SARA: Structure-Aware Riemannian-Guided Alignment for Drone Image-Text Retrieval
- High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control
- Warp-free Cross-view Geo-localization via Feature-space Consensus Mining
- OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution
- Accurate Zero-shot Quantization via Hierarchical Teacher-Assistant Distillation
- Flash-DD: An Ultra Parameter-Efficient Approach to Dataset Distillation
- What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting?
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
- Iterative Refinement of Semantic and Spatial Representations for Open-Vocabulary Camouflaged Object Segmentation
- Zero-Shot Inference-Time Rectification for Real-World Arbitrary-Scale Super-Resolution
- Image Warping for Image-to-Image Translation
- UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
- CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA
- MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
- Visual Spatial Tuning
- UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations
- MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
- Unsupervised Point Cloud Registration via Training-Time Semantic Guidance
- Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation
- Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering
- EGVLR: Evidence-Grounded Vision–Language Reinforcement for Anomaly Reasoning
- Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments
- VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
- VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus
- Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
- BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension
- HERO: Heterogeneous Evidential Robust Object-Level Collaborative Perception
- Pixel-wise Geo-registration of Drone and Satellite Images
- Markov-Renewal Single-Photon LiDAR Simulator
- Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration
- Thinking from the Robot’s View: The CoT-HRC Benchmark for Human Intent Reasoning in Embodied Collaboration
- RECO: Region-Aware Compensation for Extrinsic Perturbations in Roadside 3D Detection
- DiverseAD: A Large-Scale Driving Dataset with Diverse Atmospheric Conditions
- Iterative Perceptual Alignment for VLMs via Deterministic Reconstruction Feedback
- ViTAL‑X: Video-Text Alignment with Cross‑Modal Temporal Edits
- Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning
- RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory
- FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction
- E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
- AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion
- OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning
- ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
- BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
- RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
- ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance
- MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model
- Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-shot Real-World Deployment
- Personalizing MLLMs via Reinforced Multimodal Reference Game
- HumanOmni-Speaker: Identifying Who said What and When
- LangLoc: “Tell Me What You See”
- Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning
- Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- StrucTab: A Structured Optimization Framework for Table Parsing
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Counting Trees from Satellite Imagery with Noisy Supervision
- White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation
- Geometric Context Transformer for Streaming 3D Reconstruction
- RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction
- Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- What if? Emulative Simulation with World Models for Situated Reasoning
- UECP: Uncertainty-Enhanced Collaborative Perception
- SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation
- CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation
- Bootstrapping Articulated 3D Reconstruction from 2D Image Collections
- Caption Bottleneck Models
- Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field
- CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
- VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation
- 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents
- VVSim: A Large-Scale Aerial-Ground Dataset and Benchmark for Cooperative Perception
- WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation
- RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception
- Towards Metric-Agnostic Trajectory Forecasting
- MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents
- How to Teach Large Multimodal Models New Skills
- TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning
- AMCoNav: Asynchronous Multi-module Collaborative Framework for Embodied Visual Navigation
- DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving
- Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs
- Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression
- Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow
- Tactile Modality Fusion for Vision-Language-Action Models
- Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
- SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
- ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Reconstruction
- Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
- LESV:Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding
- EgoTraj: Real-World Egocentric Human Trajectory
- World Models for Learning Dexterous Hand-Object Interactions from Human Videos
- GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation
- RAGrasp: A Retrieval-Augmented Framework with Diversity-Aware Modeling for Dexterous Grasp Generation
- ORION: Ordinal Neural Collapse as a Representation Prior for Visual Navigation
- GameWorlds: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
- FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
- PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation
- A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR
- CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
- MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos
- ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
- Learning Active Perception for Pixel-Space Reasoning via Visual-Intent Stratified GRPO
- Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
- BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning
- Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
- GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
- Experts-Guided Unbalanced Optimal Transport for ISP Learning from Unpaired and/or Paired Data
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
- E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework
- SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
- Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- Walk through Paintings : Ego-centric World models from Internet Priors
- Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen
- Mixture of Specialized Vision Experts: Unlocking Complementary Visual Insights for Faithful MLLM Reasoning
- ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
- MotionChain: Fine-Grained Video Motion Understanding via Structured Decomposition
- GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation
- PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving
- Geometry-Aware Spatio-Temporal Context Modeling for 4D Occupancy Forecasting
- SuperFlex: Deformable Superquadrics for Point Cloud Decomposition
- DriveVA: Video Action Models are Zero-Shot Drivers
- SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction
- SP-TransientBench: A Real-Captured Single Photon Perception Benchmark
- Map2World: Segment Map Conditioned Text to 3D World Generation
- G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation
- NeSy-Route: A Neural-Symbolic Benchmark for Constrained Route Planning in Remote Sensing
- TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches
- Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting
- ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
- Towards Practical Lossless Neural Compression for LiDAR Point Clouds
- VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling
- SegFly: A 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale
- Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
- TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation
- BitRIC: Efficient Neural Compression of LiDAR Range Images via Hierarchical Bitplanes
- Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound
- HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
- HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
- Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs
- CogniCred: A Dataset and Benchmark for Cognitive Credential Forgery Detection
- ASSCG: Just-Right Gating over Chattering for Fast–Slow LLM Planning in Autonomous Driving
- Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models
- Boba: Batched Simulation for Physics-Based Gaussian Digital Twins
- TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception
- CMDR: Contextual Multimodal Document Retrieval
- ContextFlow: In-Context Flow Matching for Robot Manipulation
- DoCoG: Mask-based Multi-Type Grounded Chain-of-Thought for Document QA
- When Sinks Help or Hurt: Unified Framework for Attention Sink in MLLMs
- OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents
- Masked Depth Modeling for Spatial Perception
- Twin-DAgger: Synergizing Digital Twins and Human Corrections for Efficient Robot Manipulation
- Error-Driven Scene Editing for 3D Grounding in Large Language Models
- What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA
- Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
- See & Sniff: Learning Visuo-Olfactory Representations
- Improving Reasoning in Vision-Language Models via Perception Verified Self-Training
- Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability
- OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
- Two-Way Street: Efficient VSLAM using Collaborative In-Sensor and Off-Sensor processing
- VisCritic: Visual State Comparison as Process Reward for GUI Agents
- C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation
- Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
- EatVid-Bench: A Multimodal Fine-Grained Eating Behavior Video Dataset
- Lifting Ego World Models for Planning and Control
- RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
- Learning Transferable Dynamics Priors from Action to World Modeling
- Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis
- HighlightBench: Benchmarking and Diagnosing Markup-Driven Table Reasoning in Scientific Documents
- SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection
- Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs
- Pano3D: Unified 3D Reconstruction and Panoptic Segmentation
- RAE-NWM: Navigation World Model in Dense Visual Representation Space
- Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
- WALL-EVE: World Alignment with Rule Learning in Visual Environments
- The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
- OmniNWM: Unifying the State-Action-Reward Triad for Closed-Loop Panoramic Driving Navigation World Models
- The Telephone Game: Evaluating Semantic Drift in Unified Models
- HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning
- MessyKitchens: Contact-rich object-level 3D scene reconstruction
- OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
- Sentinel: Embodied Cooperative Spatial Reasoning and Planning
- UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
- SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation
- Multiple Images Distract Large Multimodal Models via Attention Fragmentation
- COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models
- Learning Sample-wise Rank-Aware Interpolation Weights for Composed Visual Data Retrieval
- Spotlight: Identifying and Localizing Video Generation Errors Using VLMs
- Incentivizing Vision Language Models to Search for Long Video Question Answering
- Spatial Amsan: A Benchmark for Perception-Grounded Spatial Reasoning and Action Evaluation in Egocentric Manipulation
- The Language of Visual Attention: Modeling Scanpaths via Autoregressive Token Prediction
- PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation
- HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection
- Wavelet-based Intra-video Counterfactual Reasoning for Video Question Grounding
- MARché: Fast Masked Autoregressive Image Generation with Cache-Aware Attention
- MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
- Pose Anything Anywhere: Model-free Object Poses from Arbitrary References
- Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
- Vulnerability of Privacy-Preserving Visual Localization against Diffusion-based Attacks
- 3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints
- UniQueR: Unified Query-based Feedforward 3D Reconstruction
- Knowledge-Centric Agents for Workflow Generation in ComfyUI
- Video-Text Alignment Model for Sign Language Translation
- Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM
- Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
- WildWorld: A Large-Scale Dataset for Action-Conditioned World Modeling with Explicit State Annotations
- FUSE: A Flow-based Mapping Between Shapes
- WildCity: A Real-World Dataset for City-Scale Rendering and Beyond
- SE-DETR: Explicit Semantic Exploration for Generalizability and Distinguishability in Video Temporal Grounding
- Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces
- When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
- CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics
- OCA: ODE-Driven Cross-Attention for Image-to-Point-Cloud Registration
- EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
- Predicting Consequences and Reinforcing Navigation Policies with Latent World Models
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
- TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing
- Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray
- RadarGen: Automotive Radar Point Cloud Generation from Cameras
- Spectral Evolution-Guided Token Pruning in Large Multimodal Models
- Unbalanced Optimal Transport for Efficient Visual Document Retrieval
- On the Faithfulness of Post-Hoc Concept Bottleneck Models
- MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling
- Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation
- PrintAnything: Learning Geometric Plan Map for 3D Printing G-code Generation from Unoriented Point Clouds
- AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution
- AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- InstrAct: Towards Action-Centric Understanding in Instructional Videos
- SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection
- CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
- Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
- RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather
- Driving like yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving
- One Demonstration Is Enough for Real-World Robotic Reinforcement Learning
- FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
- ZTRS: Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer
- Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
- Ex-Sim(3)-Reg: 2D-3D Correspondence Pruning via Extended Sim(3) Registration
- 360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method
- Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch
- SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for RGB+Thermal 3D Reconstruction
- Co-Steer: Cross-Modal Collaborative Steering for Jailbreaking MLLMs
- BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
- SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
- CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views
- Towards High-Resolution Visual Perception via Hierarchical Entity Exploration
- Fast and Scalable LiDAR Data Generation for Autonomous Driving Simulation without Raycasting
- YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos
- DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation
- MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data
- SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers
- SwiftWA: An Efficient Action-Centered World-Action Model
- When the City Teaches the Car: Label-Free 3D Perception from Infrastructure
- VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
- CabinSI: Omni-Cabin Spatial Reasoning through Explicit Visual Cognitive Maps
- DRS-VPT: Directly Re-localizing in Scenes using a Vision and Point Transformer
- Zero-Shot Novel Depth Synthesis Using Foundation Models Scene Representations
- NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
- Geo-DPO: Aligning Semantic Intent with Geometry for 3D Affordance Segmentation
- Event-LiDAR: 3D Eventification for Efficient Point Cloud Processing
- Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces
- A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world
- LiFlow: Flow Matching for 3D LiDAR Scene Completion
- Agentic Collaborative Cognition for Zero-Shot 3D Understanding
- LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows
- SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos
- MobileManiBench: Simplifying Model Verification for Mobile Manipulation
- RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation
- Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics
- ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
- SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- Multi-label Instance-level Generalised Visual Grounding in Agriculture
- Stabilizing Real-World Visual Active Tracking with Action-Smooth Test-Time Adaptation
- Unpaired Geometry-Guided Sim2Real Translation for Autonomous Driving
- HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions
- MG2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
- HippoCamp: Benchmarking Contextual Agents on Personal Computers
- Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity
- VPA-WM: Vision-Priors-Aligned World Models for Robust Visual Reinforcement Learning
- SWIFT: Spatial-Window Integrated Frequency-aware Token Pruning for Efficient MLLMs on Edge Devices
- Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction
- OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction
- SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities
- ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control
- HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
- Taming LLMs for Codematic Indoor Scene Generation
- On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models
- S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight
- DocLayout-VL: A Foundational Model for Hierarchical, Open-set, and Promptable Document Layout Segmentation
- UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
- Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation
- Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
- Event-Driven Video Generation
- XDen-1K: A Density Field Dataset of Real-World Objects
- SPEAR: A Simulator for Photorealistic Embodied AI Research
- ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency
- GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation
- Self-Evolving Just-In-Time Memory for Proactive Embodied Safety
- What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework
- PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas
- CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
- Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
- OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder
- Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
- Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
- E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
- VOCA: Visual Odometry with Codec Awareness
- SLAM-Former: Putting SLAM into One Transformer
- GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
- OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents
- GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
Spotlights
- CFM: Language-aligned Concept Foundation Model for Vision
- AdaBoosting Text Prompts for Vision-Language Models
- GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
- Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
- DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
- Molmo-Point: Better Pointing for VLMs with Grounding Tokens
- Edit3r: Instant 3D Scene Editing from Sparse Unposed Images
- Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
- PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS
- Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
- ReSplat: Learning Recurrent Gaussian Splatting
- Learning to Deny: Action Denial in Multimodal Large Language Models
- SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
- PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
- GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
- SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization
- On Test-Time Scaling for Vision-Language Models
- Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering
- URoPE: Universal Relative Position Embedding across Geometric Spaces
- Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction
- Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
- EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development
- RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
- SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
- TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid
- Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation
- On the Reliability of Cue Conflict and Beyond
- Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation
- One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
- VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation
- TR-MoE: Temporal Reliability-Aware Mixture-of-Experts for Robust Tracking
- RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement
- Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
- Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
- Proteus: Model Leakage-Induced Adversarial Attack in Federated Learning
- Event-based Sparse-view Background-Oriented Schlieren Tomography
- Zero-shot Depth from Defocus
- Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations
- Bayesian Self-Attention with Local Pixel Correlations for Lightweight Denoising Transformers
- When Higher Order Hurts: Pre-Asymptotic Order Collapse in Generative ODE Sampling — A Theory of Discretization–Learning Interaction
- PolarAPP: Beyond Polarization Demosaicking for Polarimetric Applications
- Structured-Noise Masked Modeling for Video, Audio and Beyond
- Stokes-Informed Diffusion for Robust Linear Polarization Estimation
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- Off the Planckian Locus: Using 2D Chromaticity to Improve In-Camera Color
- RoMa v2: Harder Better Faster Denser Feature Matching
- LoMa: Local Feature Matching Revisited
- Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding
- Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features
- GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos
- Rolling Shutter Camera Self-Calibration
- Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
- OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization
- MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
- E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects
- Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
- SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers
- Monocular Models are Strong Learners for Multi-View Human Mesh Recovery
- Training-free Controllable Motion Generation under Heterogeneous Constraints
- EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices
- OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer
- Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction
- VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation
- OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
- RADmesh: Remesh-Aware Mesh Deformation
- CameraAnything: Refilming Videos with Arbitrary Camera Control
- Face Anything: 4D Face Reconstruction from Any Image Sequence
- A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models
- InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image
- Grounding World Simulation Models in a Real-World Metropolis
- Silhouette-based Gait Foundation Model
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
- Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
- QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification
- AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
- Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
- EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
- RiO-DETR: DETR for Real-time Oriented Object Detection
- Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels
- Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
- Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting
- Push–Pull Attentional Anchoring for Diffusion Concept Erasure
- SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors
- When Rubrics Fail: Error Enumeration as Reward for Reference-Free RL Post-Training
- PhenoLeaf-TS: A Time-Series Benchmark for Leaf Instance Segmentation, Tracking, and Growth Stage Classification
- Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting
- Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games
- DoCoG: Mask-based Multi-Type Grounded Chain-of-Thought for Document QA
- SPEAR: A Simulator for Photorealistic Embodied AI Research
- SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction
- Predicting Consequences and Reinforcing Navigation Policies with Latent World Models
- NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
- Incentivizing Vision Language Models to Search for Long Video Question Answering
- Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch
- HumanOmni-Speaker: Identifying Who said What and When
- Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen
- UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
- TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception
- See & Sniff: Learning Visuo-Olfactory Representations
- VOCA: Visual Odometry with Codec Awareness
- Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving
- CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
- When Sinks Help or Hurt: Unified Framework for Attention Sink in MLLMs
- MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model
- How to Teach Large Multimodal Models New Skills
- CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization
- Event-Driven Video Generation
- VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation
Report issues here.
Successful Page Load