Back to Toon

Benchmarks

docs/guide/benchmarks.md

4.1.022.6 KB
Original Source

Benchmarks

The benchmarks on this page measure TOON's performance across two key dimensions:

  • Retrieval Accuracy: How well LLMs understand and extract information from different input formats.
  • Token Efficiency: How many tokens each format requires to represent the same data.

Benchmarks are organized into two tracks to ensure fair comparisons:

  • Mixed-Structure Track: Nested and semi-uniform datasets (TOON vs JSON, YAML, XML). CSV is excluded โ€“ it cannot represent these structures without lossy flattening.
  • Flat-Only Track: Flat, fully tabular-eligible datasets, where CSV is a fair competitor (CSV vs TOON vs JSON, YAML, XML).

Retrieval Accuracy

<!-- automd:file src="../../benchmarks/results/retrieval-accuracy.md" -->

Benchmarks test LLM comprehension across different input formats using 244 data retrieval questions on 4 models.

<details> <summary><strong>Show Dataset Catalog</strong></summary>

Dataset Catalog

DatasetRowsStructureCSV SupportEligibility
Uniform employee records100uniformโœ“100%
E-commerce orders with nested structures50nestedโœ—33%
Time-series analytics data60uniformโœ“100%
Top 100 GitHub repositories100uniformโœ“100%
Semi-uniform event logs75semi-uniformโœ—50%
Deeply nested configuration1deepโœ—0%
Valid complete dataset (control)20uniformโœ“100%
Array truncated: 3 rows removed from end20uniformโœ“100%
Extra rows added beyond declared length20uniformโœ“100%
Inconsistent field count (missing salary in row 10)20uniformโœ“100%
Missing required fields (no email in multiple rows)20uniformโœ“100%
Feature flags keyed by name40uniformโœ—100%
Contacts with nested address and plan groups50nestedโœ—100%

Structure classes:

  • uniform: All objects have identical fields with primitive values
  • semi-uniform: Mix of uniform and non-uniform structures
  • nested: Objects with nested structures (nested objects or arrays)
  • deep: Highly nested with minimal tabular eligibility

CSV Support: โœ“ (supported), โœ— (not supported โ€“ would require lossy flattening)

Eligibility: Percentage of arrays that qualify for TOON's tabular form (uniform objects with primitive values)

</details>

Efficiency Ranking (Accuracy per 1K Tokens)

Each format ranked by efficiency (accuracy percentage per 1,000 tokens):

TOON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ   29.2 acc%/1K tok  โ”‚  72.2%  ยฑ2.8 acc  โ”‚  2,474 tokens
JSON compact   โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘   23.8 acc%/1K tok  โ”‚  69.0%  ยฑ2.9 acc  โ”‚  2,892 tokens
YAML           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘   20.1 acc%/1K tok  โ”‚  70.1%  ยฑ2.9 acc  โ”‚  3,487 tokens
JSON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘   16.6 acc%/1K tok  โ”‚  71.4%  ยฑ2.8 acc  โ”‚  4,308 tokens
XML            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘   14.4 acc%/1K tok  โ”‚  70.7%  ยฑ2.9 acc  โ”‚  4,909 tokens

Efficiency score = (Accuracy % รท Tokens) ร— 1,000. Higher is better.

[!TIP] TOON achieves 72.2% accuracy (vs JSON's 71.4%) while using 42.6% fewer tokens.

[!NOTE] CSV is excluded from the ranking as it only supports 109 of 244 questions (flat tabular data only). While CSV is highly token-efficient for simple tabular data, it cannot represent nested structures that other formats handle.

Accuracy on Flat Datasets

Every format answers the same 109 flat-dataset questions per model, so CSV can be compared on equal footing here.

FormatAccuracyCorrect/TotalAvg Tokens
toon63.1% ยฑ4.5275/4361,994
csv62.2% ยฑ4.5271/4361,851
json-pretty60.3% ยฑ4.6263/4363,950
xml60.1% ยฑ4.6262/4364,516
yaml59.9% ยฑ4.6261/4363,270
json-compact58.0% ยฑ4.6253/4362,718

Per-Model Accuracy

Accuracy across 4 LLMs on 244 data retrieval questions:

claude-haiku-4-5-20251001
โ†’ TOON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    65.6% ยฑ5.9 (160/244)
  JSON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    63.5% ยฑ6.0 (155/244)
  XML            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    62.3% ยฑ6.0 (152/244)
  YAML           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    62.3% ยฑ6.0 (152/244)
  JSON compact   โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    61.9% ยฑ6.0 (151/244)
  CSV            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    49.5% ยฑ9.2 (54/109)

gemini-3.6-flash
โ†’ TOON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    69.3% ยฑ5.8 (169/244)
  JSON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    68.4% ยฑ5.8 (167/244)
  YAML           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    67.6% ยฑ5.8 (165/244)
  XML            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    65.2% ยฑ5.9 (159/244)
  JSON compact   โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    63.5% ยฑ6.0 (155/244)
  CSV            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    57.8% ยฑ9.1 (63/109)

gpt-5.4-nano
  XML            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    59.4% ยฑ6.1 (145/244)
  JSON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    57.4% ยฑ6.2 (140/244)
โ†’ TOON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    57.0% ยฑ6.2 (139/244)
  JSON compact   โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    54.9% ยฑ6.2 (134/244)
  YAML           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    54.5% ยฑ6.2 (133/244)
  CSV            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    46.8% ยฑ9.2 (51/109)

grok-4.5
โ†’ TOON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    97.1% ยฑ2.2 (237/244)
  JSON           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    96.3% ยฑ2.5 (235/244)
  XML            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    95.9% ยฑ2.6 (234/244)
  YAML           โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    95.9% ยฑ2.6 (234/244)
  JSON compact   โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    95.5% ยฑ2.7 (233/244)
  CSV            โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    94.5% ยฑ4.5 (103/109)

[!NOTE] Accuracy figures include Wilson 95% confidence intervals (ยฑ); when two formats' intervals overlap, the difference between them is not statistically meaningful. CSV answers only the 109 flat-dataset questions, so its per-model cells cover a smaller, easier population than the other formats.

<details> <summary><strong>Performance by dataset and question type</strong></summary>

Performance by Question Type

Question TypeTOONJSONXMLYAMLJSON compactCSV
Field Retrieval97.8%99.2%99.2%99.7%98.9%100.0%
Aggregation48.4%48.4%46.0%46.0%45.2%32.8%
Filtering38.0%41.1%37.5%40.1%38.0%33.3%
Structure Awareness90.3%84.0%84.0%79.2%78.5%82.8%
Structural Validation100.0%50.0%80.0%50.0%45.0%80.0%

Performance by Dataset

Uniform employee records
FormatAccuracyTokensCorrect/Total
csv64.6%2,336106/164
toon62.8%2,537103/164
json-compact62.2%3,919102/164
yaml64.0%4,982105/164
json-pretty62.2%6,326102/164
xml61.0%7,286100/164
E-commerce orders with nested structures
FormatAccuracyTokensCorrect/Total
json-compact70.7%6,875116/164
toon71.3%7,344117/164
yaml72.0%8,456118/164
json-pretty71.3%10,842117/164
xml74.4%12,180122/164
Time-series analytics data
FormatAccuracyTokensCorrect/Total
csv64.2%1,40877/120
toon63.3%1,59576/120
json-compact59.2%2,35171/120
yaml62.5%2,95175/120
json-pretty65.0%3,67878/120
xml62.5%4,38675/120
Top 100 GitHub repositories
FormatAccuracyTokensCorrect/Total
toon57.6%9,01776/132
csv54.5%8,72672/132
json-compact53.8%11,65071/132
yaml53.8%13,35071/132
json-pretty55.3%15,35073/132
xml53.8%17,30471/132
Semi-uniform event logs
FormatAccuracyTokensCorrect/Total
json-compact56.7%4,79368/120
toon60.8%5,81473/120
json-pretty60.0%6,75972/120
yaml55.0%5,79866/120
xml50.8%7,66861/120
Deeply nested configuration
FormatAccuracyTokensCorrect/Total
json-compact91.4%562106/116
yaml93.1%675108/116
toon91.4%669106/116
json-pretty94.8%918110/116
xml94.0%1,007109/116
Valid complete dataset (control)
FormatAccuracyTokensCorrect/Total
toon100.0%5664/4
json-compact100.0%7724/4
yaml100.0%9844/4
json-pretty100.0%1,2594/4
xml0.0%1,4410/4
csv0.0%4730/4
Array truncated: 3 rows removed from end
FormatAccuracyTokensCorrect/Total
csv100.0%4084/4
toon100.0%4984/4
xml100.0%1,2294/4
json-pretty0.0%1,0750/4
yaml0.0%8410/4
json-compact0.0%6600/4
Extra rows added beyond declared length
FormatAccuracyTokensCorrect/Total
csv100.0%5474/4
toon100.0%6444/4
xml100.0%1,6634/4
json-pretty0.0%1,4520/4
yaml0.0%1,1350/4
json-compact0.0%8930/4
Inconsistent field count (missing salary in row 10)
FormatAccuracyTokensCorrect/Total
csv100.0%4704/4
toon100.0%5634/4
json-compact75.0%7673/4
xml100.0%1,4324/4
yaml75.0%9773/4
json-pretty75.0%1,2513/4
Missing required fields (no email in multiple rows)
FormatAccuracyTokensCorrect/Total
csv100.0%4424/4
toon100.0%5354/4
xml100.0%1,3864/4
yaml75.0%9413/4
json-pretty75.0%1,2073/4
json-compact50.0%7322/4
Feature flags keyed by name
FormatAccuracyTokensCorrect/Total
toon97.1%93166/68
json-compact94.1%1,26464/68
yaml92.6%1,44363/68
json-pretty95.6%1,87365/68
xml95.6%2,30665/68
Contacts with nested address and plan groups
FormatAccuracyTokensCorrect/Total
toon94.4%1,44468/72
json-compact91.7%2,35766/72
yaml94.4%2,79768/72
json-pretty97.2%4,01470/72
xml98.6%4,53471/72
</details>

Run Configuration

  • Models tested: claude-haiku-4-5-20251001, gemini-3.6-flash, gpt-5.4-nano, grok-4.5
  • Formats compared: TOON, JSON, XML, YAML, JSON compact, CSV
  • Token counting: Using gpt-tokenizer with o200k_base encoding (GPT-5 tokenizer). Other providers tokenize differently, so absolute counts are tokenizer-specific; relative differences between formats hold directionally.
  • Reasoning: Disabled via the AI SDK's universal reasoning: 'none' (Gemini 3 floors at minimal thinking, grok-4.5 at low)
  • Temperature: Not set (models use their defaults)
  • Total evaluations: 244 questions ร— 6 formats ร— 4 models = 5,856 LLM calls

What the datasets contain, how the questions are generated, and how answers are validated is documented in the benchmark README.

<!-- /automd -->

Token Efficiency

Token counts are measured using the GPT-5 o200k_base tokenizer via gpt-tokenizer. Savings are calculated against formatted JSON (2-space indentation) as the primary baseline, with additional comparisons to compact JSON (minified), YAML, and XML. Actual savings vary by model and tokenizer.

The benchmarks test datasets across different structural patterns (uniform, semi-uniform, nested, deeply nested) to show where TOON excels and where other formats may be better.

<!-- automd:file src="../../benchmarks/results/token-efficiency.md" -->

Mixed-Structure Track

Datasets with nested or semi-uniform structures. CSV excluded as it cannot properly represent these structures.

๐Ÿ›’ E-commerce orders with nested structures  โ”Š  Tabular: 33%
   โ”‚
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    72,832 tokens
   โ”œโ”€ vs JSON          (โˆ’32.9%)               108,611 tokens
   โ”œโ”€ vs JSON compact  (+5.6%)                 68,944 tokens
   โ”œโ”€ vs YAML          (โˆ’14.0%)                84,701 tokens
   โ””โ”€ vs XML           (โˆ’40.4%)               122,119 tokens

๐Ÿงพ Semi-uniform event logs  โ”Š  Tabular: 50%
   โ”‚
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘   154,084 tokens
   โ”œโ”€ vs JSON          (โˆ’15.0%)               181,201 tokens
   โ”œโ”€ vs JSON compact  (+19.9%)               128,529 tokens
   โ”œโ”€ vs YAML          (โˆ’0.8%)                155,397 tokens
   โ””โ”€ vs XML           (โˆ’25.2%)               205,859 tokens

๐Ÿงฉ Deeply nested configuration  โ”Š  Tabular: 0%
   โ”‚
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘       589 tokens
   โ”œโ”€ vs JSON          (โˆ’34.9%)                   905 tokens
   โ”œโ”€ vs JSON compact  (+6.7%)                    552 tokens
   โ”œโ”€ vs YAML          (โˆ’11.0%)                   662 tokens
   โ””โ”€ vs XML           (โˆ’40.9%)                   997 tokens

๐Ÿ“Š Feature flags keyed by name  โ”Š  Tabular: 100%
   โ”‚
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    10,503 tokens
   โ”œโ”€ vs JSON          (โˆ’54.6%)                23,141 tokens
   โ”œโ”€ vs JSON compact  (โˆ’32.8%)                15,635 tokens
   โ”œโ”€ vs YAML          (โˆ’41.3%)                17,905 tokens
   โ””โ”€ vs XML           (โˆ’63.3%)                28,655 tokens

๐Ÿ“Š Contacts with nested address and plan groups  โ”Š  Tabular: 100%
   โ”‚
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘    26,726 tokens
   โ”œโ”€ vs JSON          (โˆ’66.5%)                79,779 tokens
   โ”œโ”€ vs JSON compact  (โˆ’42.9%)                46,791 tokens
   โ”œโ”€ vs YAML          (โˆ’51.8%)                55,475 tokens
   โ””โ”€ vs XML           (โˆ’70.4%)                90,306 tokens

โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€ Total โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘โ–‘โ–‘โ–‘โ–‘โ–‘   264,734 tokens
   โ”œโ”€ vs JSON          (โˆ’32.7%)               393,637 tokens
   โ”œโ”€ vs JSON compact  (+1.6%)                260,451 tokens
   โ”œโ”€ vs YAML          (โˆ’15.7%)               314,140 tokens
   โ””โ”€ vs XML           (โˆ’40.9%)               447,936 tokens

Flat-Only Track

Datasets with flat, fully tabular-eligible data where CSV is applicable.

๐Ÿ‘ฅ Uniform employee records  โ”Š  Tabular: 100%
   โ”‚
   CSV                 โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    47,153 tokens
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ    49,978 tokens   (+6.0% vs CSV)
   โ”œโ”€ vs JSON          (โˆ’60.7%)               127,061 tokens
   โ”œโ”€ vs JSON compact  (โˆ’36.8%)                79,057 tokens
   โ”œโ”€ vs YAML          (โˆ’50.0%)               100,054 tokens
   โ””โ”€ vs XML           (โˆ’65.9%)               146,605 tokens

๐Ÿ“ˆ Time-series analytics data  โ”Š  Tabular: 100%
   โ”‚
   CSV                 โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘โ–‘     8,383 tokens
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ     9,115 tokens   (+8.7% vs CSV)
   โ”œโ”€ vs JSON          (โˆ’59.0%)                22,245 tokens
   โ”œโ”€ vs JSON compact  (โˆ’35.9%)                14,211 tokens
   โ”œโ”€ vs YAML          (โˆ’49.0%)                17,858 tokens
   โ””โ”€ vs XML           (โˆ’65.8%)                26,616 tokens

โญ Top 100 GitHub repositories  โ”Š  Tabular: 100%
   โ”‚
   CSV                 โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘     8,711 tokens
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ     8,937 tokens   (+2.6% vs CSV)
   โ”œโ”€ vs JSON          (โˆ’41.7%)                15,337 tokens
   โ”œโ”€ vs JSON compact  (โˆ’23.2%)                11,640 tokens
   โ”œโ”€ vs YAML          (โˆ’33.0%)                13,337 tokens
   โ””โ”€ vs XML           (โˆ’48.3%)                17,294 tokens

โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€ Total โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€
   CSV                 โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–‘    64,247 tokens
   TOON                โ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆโ–ˆ    68,030 tokens   (+5.9% vs CSV)
   โ”œโ”€ vs JSON          (โˆ’58.7%)               164,643 tokens
   โ”œโ”€ vs JSON compact  (โˆ’35.2%)               104,908 tokens
   โ”œโ”€ vs YAML          (โˆ’48.2%)               131,249 tokens
   โ””โ”€ vs XML           (โˆ’64.3%)               190,515 tokens

Token counts use gpt-tokenizer with o200k_base encoding (GPT-5 tokenizer). Other providers tokenize differently, so absolute counts are tokenizer-specific; relative differences between formats hold directionally.

<details> <summary><strong>Show detailed examples</strong></summary>

๐Ÿ“ˆ Time-series analytics data

Savings: 13,130 tokens (59.0% reduction vs JSON)

JSON (22,245 tokens):

json
{
  "metrics": [
    {
      "date": "2025-01-01",
      "views": 6138,
      "clicks": 174,
      "conversions": 12,
      "revenue": 2712.49,
      "bounceRate": 0.35
    },
    {
      "date": "2025-01-02",
      "views": 4616,
      "clicks": 274,
      "conversions": 34,
      "revenue": 9156.29,
      "bounceRate": 0.56
    },
    {
      "date": "2025-01-03",
      "views": 4460,
      "clicks": 143,
      "conversions": 8,
      "revenue": 1317.98,
      "bounceRate": 0.59
    },
    {
      "date": "2025-01-04",
      "views": 4740,
      "clicks": 125,
      "conversions": 13,
      "revenue": 2934.77,
      "bounceRate": 0.37
    },
    {
      "date": "2025-01-05",
      "views": 6428,
      "clicks": 369,
      "conversions": 19,
      "revenue": 1317.24,
      "bounceRate": 0.3
    }
  ]
}

TOON (9,115 tokens):

metrics[5]{date,views,clicks,conversions,revenue,bounceRate}:
  2025-01-01,6138,174,12,2712.49,0.35
  2025-01-02,4616,274,34,9156.29,0.56
  2025-01-03,4460,143,8,1317.98,0.59
  2025-01-04,4740,125,13,2934.77,0.37
  2025-01-05,6428,369,19,1317.24,0.3

โญ Top 100 GitHub repositories

Savings: 6,400 tokens (41.7% reduction vs JSON)

JSON (15,337 tokens):

json
{
  "repositories": [
    {
      "id": 132750724,
      "name": "build-your-own-x",
      "repo": "codecrafters-io/build-your-own-x",
      "description": "Master programming by recreating your favorite technologies from scratch.",
      "createdAt": "2018-05-09T12:03:18Z",
      "updatedAt": "2026-07-23T18:57:15Z",
      "pushedAt": "2026-07-14T19:25:58Z",
      "stars": 530712,
      "watchers": 6778,
      "forks": 50205,
      "defaultBranch": "master"
    },
    {
      "id": 21737465,
      "name": "awesome",
      "repo": "sindresorhus/awesome",
      "description": "๐Ÿ˜Ž Awesome lists about all kinds of interesting topics",
      "createdAt": "2014-07-11T13:42:37Z",
      "updatedAt": "2026-07-23T18:57:24Z",
      "pushedAt": "2026-06-30T18:21:16Z",
      "stars": 488074,
      "watchers": 8292,
      "forks": 36010,
      "defaultBranch": "main"
    },
    {
      "id": 28457823,
      "name": "freeCodeCamp",
      "repo": "freeCodeCamp/freeCodeCamp",
      "description": "freeCodeCamp.org's open-source codebase and curriculum. Learn math, programming,โ€ฆ",
      "createdAt": "2014-12-24T17:49:19Z",
      "updatedAt": "2026-07-22T07:01:33Z",
      "pushedAt": "2026-07-21T18:00:51Z",
      "stars": 452380,
      "watchers": 8590,
      "forks": 45624,
      "defaultBranch": "main"
    }
  ]
}

TOON (8,937 tokens):

repositories[3]{id,name,repo,description,createdAt,updatedAt,pushedAt,stars,watchers,forks,defaultBranch}:
  132750724,build-your-own-x,codecrafters-io/build-your-own-x,Master programming by recreating your favorite technologies from scratch.,"2018-05-09T12:03:18Z","2026-07-23T18:57:15Z","2026-07-14T19:25:58Z",530712,6778,50205,master
  21737465,awesome,sindresorhus/awesome,๐Ÿ˜Ž Awesome lists about all kinds of interesting topics,"2014-07-11T13:42:37Z","2026-07-23T18:57:24Z","2026-06-30T18:21:16Z",488074,8292,36010,main
  28457823,freeCodeCamp,freeCodeCamp/freeCodeCamp,"freeCodeCamp.org's open-source codebase and curriculum. Learn math, programming,โ€ฆ","2014-12-24T17:49:19Z","2026-07-22T07:01:33Z","2026-07-21T18:00:51Z",452380,8590,45624,main
</details> <!-- /automd -->