Compositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing
Published 16 Sept 2026arXiv:2609.14657
Updated 7 h ago · first seen 15 Sept 2026
paper_01M2JK19B69AT3C7T4XAXA6NJR
Abstract
While Vision-Language Models (VLMs) excel at visual reasoning, generating structured, editable Scalable Vector Graphics (SVG) remains a fundamental challenge. Existing pipelines predominantly yield flat, semantically agnostic collections of paths, where editing a single object requires manually identifying its constituent paths. To address this, we propose a VLM-driven agentic framework for semantic compositional SVG generation. Our pipeline recursively parses visual scenes into semantic and geometric hierarchies via top-down decomposition, visual grounding, and prompt-driven amodal occlusion recovery, ensuring each component is geometrically complete. Furthermore, we introduce the Semantic SVG Benchmark with human-annotated semantic groups and novel sub-component metrics (Semantic Recall/Precision, PERE) to explicitly evaluate structural compositionality and functional editability. Experiments show that our natively predicted structures surpass the upper bounds of existing flat-generation methods in both grouping quality and editability, while maintaining state-of-the-art visual fidelity.
Organizations
Organizations 0
No organization stated. arXiv metadata does not carry affiliations; an organization is linked only when a model card or lab page cites the paper.
Models
Models introduced or described 0
Inbound described_by relations from model cards and documentation.
No model links this paper yet
Datasets
Datasets used 0
No dataset relation recorded.
Benchmarks
Benchmarks used 0
No benchmark relation recorded.
Code
Repositories & frameworks 0
No repository linked.
Timeline
Timeline 4
Compositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing: arxiv announce type changed from new to cross
Arxiv announce typenew→crossarxivCompositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing: published at changed from 2026-09-15T04:00:00+00:00 to 2026-09-16T04:00:00+00:00
Published15 Sept 2026→16 Sept 2026arxivCompositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing: arxiv announce type changed from cross to new
Arxiv announce typecross→newarxivNew paper: Compositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing
arxiv
Sources
Sources 2
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.