Skip to content
AI Atlas
PaperActive

SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem

arxiv.org/abs/2609.07064

quality59

Updated 1 h ago · first seen 11 Sept 2026

paper_01M294WYDPBZCXJ1FMAK30Z44W

Published
7 Sept 2026
T2 · 7 h ago
arXiv
2609.07064
T2 · 7 h ago

As of

Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.

Claim history

15 claims · 11 properties

Official pageofficial_url1

Claim history for Official page
ValueValid from → toStatusSourceConfidenceExtractor
https://arxiv.org/abs/2609.07064currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Abstractabstract1

Claim history for Abstract
ValueValid from → toStatusSourceConfidenceExtractor
Large Vision-Language Models (LVLMs) have achieved strong performance on diverse visual tasks, yet their ability to reconstruct and reason about the 3D structure of the scene depicted in 2D images -- referred to as spatial intelligence -- remains limited. Existing approaches attempt to address this gap by using real-scene spatial question answering datasets that require dense geometric annotations. However, constructing such labels is costly, time-consuming, and often noisy due to reliance on external perception modules. In this work, we propose a novel paradigm inspired by human cognitive development: learning foundational spatial skills through structured block-manipulation tasks. We introduce SpatialBlock-15k, a synthetic dataset of 15,000 block-stacking problems covering 3D-to-2D projection, viewpoint transformation, and structural combination. The dataset further incorporates controlled color modulation as visual cues to encourage anchor-based reasoning in visually complex conditions. Experiments demonstrate that LVLMs trained on our dataset through either direct answering or reasoning-based prediction significantly outperform baselines and generalize to real-world spatial tasks, despite the dataset's synthetic and compact nature. Code and data are available at https://github.com/rsoohyun/SpatialBlock.currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

arXiv idarxiv_id1

Claim history for arXiv id
ValueValid from → toStatusSourceConfidenceExtractor
2609.07064currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Authorsauthors1

Claim history for Authors
ValueValid from → toStatusSourceConfidenceExtractor
Soohyun Ryu, Sohee Kim, Eunho YangcurrentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Github repogithub_repo1

Claim history for Github repo
ValueValid from → toStatusSourceConfidenceExtractor
rsoohyun/SpatialBlockcurrentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Hf paper urlhf_paper_url1

Claim history for Hf paper url
ValueValid from → toStatusSourceConfidenceExtractor
https://huggingface.co/papers/2609.07064currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Github starsmetric.github_stars2

Claim history for Github stars
ValueValid from → toStatusSourceConfidenceExtractor
2currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic
0supersededHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Hf commentsmetric.hf_comments2

Claim history for Hf comments
ValueValid from → toStatusSourceConfidenceExtractor
2currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic
1supersededHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Upvotesmetric.upvotes3

Claim history for Upvotes
ValueValid from → toStatusSourceConfidenceExtractor
68currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic
65supersededHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic
61supersededHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

PDFpdf_url1

Claim history for PDF
ValueValid from → toStatusSourceConfidenceExtractor
https://arxiv.org/pdf/2609.07064currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Publishedpublished_at1

Claim history for Published
ValueValid from → toStatusSourceConfidenceExtractor
7 Sept 2026currentcurrentHugging Face Hub (public pages, model cards, papers)T2mediumdeterministic

Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →