Developers
Build AI products with SVGZO data.
Everything ships as files you already know how to read: parquet, tar, JSON-LD. The API follows once there is demonstrated demand.
Package layout
svgzo-<slug>-v<semver>/
README.md dataset card
LICENSE.txt tier-specific licence
NOTICES/ OFL, UFL, Apache texts; font copyright lines
croissant.json schema.org Dataset + Croissant 1.0 + RAI
provenance/ per-asset manifest; illustration sources; EU summary paragraph
metadata/ parquet shards; index.csv
svg/ tar shards, 2 to 5 GB each
svg_normalized/
previews/ 720px WebP
taxonomy/
quality/ validation, dedup and complexity reports
checksums/ SHA256SUMS per shard
CHANGELOG.mdLoading
from datasets import load_dataset
ds = load_dataset("parquet", data_files="metadata/*.parquet", split="train")Syncing a licensed dataset
# scoped credentials are issued per licence grant
rclone sync svgzo:svgzo-infographics-v1.0.0 ./infographics --checksum --progress
sha256sum -c infographics/checksums/SHA256SUMSMachine-readable metadata
Every dataset page embeds schema.org/Dataset JSON-LD that conforms to Croissant 1.0, and serves a full manifest with the record set at /datasets/{slug}/croissant.json.
API roadmap
| Endpoint | Returns | Phase |
|---|---|---|
GET /api/v1/datasets | Catalogue with versions and licence tiers | 3 |
GET /api/v1/datasets/{id} | Dataset object | 3 |
GET /api/v1/datasets/{id}/metadata | Signed URL to parquet shards | 3 |
GET /api/v1/datasets/{id}/samples | Sample pack | 3 |
GET /api/v1/assets/{id} | Asset record and signed file URL | 3 |
Later: Python SDK, dataset streaming, usage tracking.