.maestro/playbooks/Wizard-2026-02-22/2026-02-22-LoCoMo-Eval/LOCOMO-EVAL-06.md
This phase generates the final analysis comparing claude-mem against the modern memory system landscape, creates per-category and per-conversation breakdowns, and produces structured methodology and findings documents. All comparisons use dual metrics: F1 (for historical comparison) and LLM-as-a-Judge (for comparison with Mem0, Zep, OpenAI Memory, and the full-context ceiling). Latency and token efficiency metrics are included for production-readiness positioning.
Build results analyzer and generate dual comparison reports:
evals/locomo/scripts/analyze-results.tsevals/locomo/results/eval-results-*.jsonevals/locomo/src/scoring/reporter.tsSystem | Overall J | Single-hop | Multi-hop | Temporal | Open-domain
--------------------------+-----------+------------+-----------+----------+------------
Full-context | 72.90 | — | — | — | —
Claude-Mem (Opus 4.6) | {J±std} | {J±s} | {J±s} | {J±s} | {J±s}
Mem0ᵍ | 68.44 | 65.71 | 47.19 | 58.13 | 75.71
Mem0 | 66.88 | 67.13 | 51.15 | 55.51 | 72.93
Zep | 65.99 | 61.70 | 41.35 | 49.31 | 76.60
RAG (best, k=2) | 60.97 | — | — | — | —
LangMem | 58.10 | 62.23 | 47.92 | 23.43 | 71.12
OpenAI Memory | 52.90 | 63.79 | 42.92 | 21.71 | 62.29
A-Mem | 48.38 | 39.79 | 18.85 | 49.91 | 54.05
System | Single-hop F1 | Multi-hop F1 | Temporal F1 | Open-domain F1
--------------------------+---------------+--------------+-------------+---------------
Claude-Mem (Opus 4.6) | {F1} | {F1} | {F1} | {F1}
Mem0 | 38.72 | 28.64 | 48.93 | 47.65
Mem0ᵍ | 38.09 | 24.32 | 51.55 | 49.27
Zep | 35.74 | 19.37 | 42.00 | 49.56
Human | | | | (87.9 overall)
System | Search p50 | Search p95 | Total p50 | Total p95 | Tokens/Query
----------------+------------+------------+-----------+-----------+-------------
Claude-Mem | {ms} | {ms} | {ms} | {ms} | {N}
Mem0 | 148ms | 200ms | 708ms | 1,440ms | 1,764
Mem0ᵍ | 476ms | 657ms | 1,091ms | 2,590ms | 3,616
Zep | 513ms | 778ms | 1,292ms | 2,926ms | 3,911
Full-context | — | — | 9,870ms | 17,117ms | 26,031
+{X.X} or -{X.X} points vs each baseline for both J and F1bun evals/locomo/scripts/analyze-results.tsGenerate findings document:
evals/locomo/results/findings.md with YAML front matter:
---
type: report
title: "LoCoMo Eval Results: Claude-Mem Persistent Memory"
created: 2026-02-22
tags:
- locomo
- eval
- benchmark
- memory
- claude-mem
related:
- "[[Methodology]]"
---
Generate methodology document:
evals/locomo/results/methodology.md with YAML front matter:
---
type: report
title: "LoCoMo Eval Methodology: Claude-Mem"
created: 2026-02-22
tags:
- locomo
- methodology
- eval
- claude-mem
related:
- "[[LoCoMo-Eval-Results]]"
---
Generate per-conversation analysis:
evals/locomo/scripts/per-conversation-analysis.tsevals/locomo/results/findings.mdbun evals/locomo/scripts/per-conversation-analysis.ts