How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
Luyu Yang ⋅ Yutong Dai ⋅ An Yan ⋅ Viraj Prabhu ⋅ Ran Xu ⋅ Zeyuan Chen
Successful Page Load