# Brief za Claude Code — Reconciliation v2 (sa Marko odlukama) **Autor:** Claude.ai + Marko **Datum:** April 18, 2026 (v2 — updated posle Marko odluka) **Audience:** Claude Code, radi u `D:\Projects\waggle-os` **Status:** UPDATED — ovo supersedira v1 reconciliation brief --- ## 0. Locked-in odluke (Marko, April 18, 2026) **[M]-11 · Stripe pricing — LOCKED:** Pro $19/mo + Teams $49/seat/mo. **[M]-07 · hive-mind + Waggle launch timing — LOCKED:** Ship TOGETHER, ali launch gated by SOTA benchmark proof. Nema public launch-a bez brojeva koji dokazuju da hive-mind memorijski sistem pobeđuje ili izjednačava sa Mem0 (trenutni SOTA: 91.6% LoCoMo, 93.4% LongMemEval). hive-mind OSS positioning promoviše Waggle product, ali OSS release bez SOTA brojeva ne radi. **[M]-12/13/14 · Ostale Marko decisions:** TBD u sledećim sesijama, ne blokiraju trenutni sprint. **H-34 effort estimate — LOCKED:** koliko treba, toliko. 5-10 dana realno, ne 2-3. Claude Code neka ne skraćuje rad da bi pogodio neku procenu. --- ## 1. Šta ove odluke znače za backlog ### 1.1 Novi critical path Originalni backlog critical path: `H-22 GEPA Proof (18d) → H-25 Paper 2 (3d) = 21 days post-harvest`. Sa [M]-07 odlukom, **pravi critical path postaje benchmark proof, ne papers**: ``` WEEK 1: H-01..06 Polish A+B · H-26..33 Stripe · [M]-01 Stripe products H-07..10 GEPA wiring closure WEEK 2: H-11..20 Harvest Phase 1 (Gemini, Claude, Claude Code, Cursor — ChatGPT waits) Start H-34 hive-mind extraction (5-10 dana wall time) WEEK 3-4: H-34 hive-mind extraction complete (code migration) Start H-42 LoCoMo benchmark run — FIRST ATTEMPT H-21 Memory Proof parallel execution WEEK 5: LoCoMo result analysis — DECISION POINT - Ako ≥ 91.6%: proceed to launch prep - Ako 85-91%: tuning iteration, re-run - Ako < 85%: architectural investigation, postpone launch discussion H-22 GEPA Proof continues (18-day wall time) WEEK 6-7: Tuning iterations ako potrebno, ili launch prep (H-35..H-41) H-43 LongMemEval + H-44 SWE-ContextBench H-23 Combined Proof H-24/25 Papers drafting WEEK 8-9: Launch prep complete, peer review PUBLIC LAUNCH — hive-mind OSS + Waggle beta + papers, sinhronizovano WEEK 10+: fallback ako benchmarks ne pogodili target. ``` **Ključna razlika od v1 brief-a:** launch nije na fiksnom datumu. Launch je gated by LoCoMo/LongMemEval performance. To je hrabrija pozicija ali zahteva strpljenje ako prvi run pokaže 85% umesto 92%. ### 1.2 Block H12 benchmark run statusi menjaju U v1 brief-u, predložio sam H-42/43/44 kao **post-Paper-2 polish**. Sa novim [M]-07 odlukom, ovo se potpuno menja: **H-42 · LoCoMo benchmark run (NEW critical-path status):** - Pozicija: posle H-34 hive-mind extraction complete, paralelno sa H-21 Memory Proof - Ovo je SADA launch gating item, ne nice-to-have - Use `snap-research/locomo` harness — no reimplement - Run dva konfiga: local (inprocess + Ollama) i frontier (Opus 4.7 answer model) - Target: ≥ 91.6% na full benchmark, ili ≥ SOTA na barem jednoj subsekciji (temporal ili adversarial) - Effort: 3-4 dana (2 dana setup + 1-2 dana analysis + eventualna iteracija) **H-43 · LongMemEval run (critical-path):** - Target: ≥ 93.4% ili barem ≥ Zep-a (63.8%) - Effort: 2-3 dana **H-44 · SWE-ContextBench run (strategic-differentiator):** - Naš najjači teren arhitekturno - Target: top 3 - Effort: 3 dana ### 1.3 Realna pitanja koja treba da postavimo sebi Pre nego što započnemo H-42, vredi da bude jasno šta ćemo da radimo ako: **Scenario A — LoCoMo ≥ 91.6%:** launch sa "new SOTA on LoCoMo" u naslovu. Ovo je idealan slučaj, ali ne garantovan. **Scenario B — LoCoMo 85-91%:** odluka između: (a) tuning iteration (1-2 sedmice rada na hybrid search weights, RRF konstantama, embedding modelu), (b) launch sa "SOTA in local-first category" koji je slabiji ali legitiman, (c) launch sa jednom subkategorijom gde pobeđujemo (temporal reasoning verovatno). **Scenario C — LoCoMo < 85%:** arhitekturna istraga. Možda MPEG-4 I/P/B ne donosi prednost na LoCoMo strukturi (ShareGPT-style casual razgovori nisu teren gde bitemporal pomaže). Postoji legitiman rizik da arhitekturni izbori koji pomažu za Claude Code tipične workload-ove (dugi tehnički konteksti) ne pomažu za LoCoMo casual dialogue strukturu. **Moj iskren savet:** commit-uj Scenario A target, ali mentally prepare za B kao legitimni outcome. Scenario C je manji rizik ali treba da postoji plan. --- ## 2. Šta se MENJA u v1 brief-u Sve što je u v1 brief-u važi, osim: **Promenjeno:** "ship-before Waggle" → "ship-together sa SOTA gating" **Promenjeno:** timeline "Week 6 hive-mind launch, Week 8 Waggle launch" → "Week 8-9 synchronized launch, gated by benchmark results" **Promenjeno:** pricing $29/$79 → $19/$49 (potvrđeno) **Promenjeno:** H-42/43/44 pozicija u backlog-u — sada critical-path, ne post-polish **Nepromenjeno:** sve ostalo iz v1 ostaje važeće (Qwen3 elevation M-49, canonical thesis M-50, non-duplication sa research serijom, backlog fundamental shape) --- ## 3. Konkretan update za backlog-master dokument Claude Code treba da uradi sledeće izmene u `docs/plans/BACKLOG-MASTER-2026-04-18.md`: **Update #1 — [M]-11 pricing potvrda:** U [M]-01 opisu, potvrditi i fiksirati `$19/mo` i `$49/seat/mo` kao konačne. Global search/replace u `apps/www/` i drugim docs-ovima ako negde piše starije vrednosti. **Update #2 — [M]-07 odluka:** U Marko-side queue, ažurirati [M]-07 iz "ship-with or ship-before" u: ``` [M]-07 RESOLVED (Apr 18): Ship together, but launch gated by SOTA benchmark proof. No public release without LoCoMo ≥ 91.6% or equivalent competitive showing. hive-mind OSS launch serves as Waggle launch narrative vehicle. ``` **Update #3 — Novi Block H12 — Public Benchmarks (CRITICAL PATH):** Ubaciti posle H11 Auto-updater signing: ```markdown ### Block H12 — Public Benchmark Runs (LAUNCH GATING, 3 items) **These are critical path per [M]-07 decision. Launch is blocked until benchmarks validate architectural claims against current SOTA.** #### H-42 · LoCoMo benchmark run (LAUNCH GATING) - Use snap-research/locomo evaluation harness, do not reimplement - Run two configs: local (inprocess + Ollama) and frontier (Opus 4.7 answer model) - Target: ≥ 91.6% full benchmark OR ≥ SOTA on temporal/adversarial subsection - Commit full raw outputs + analysis to `docs/results/LOCOMO-RESULTS.md` - **Verify:** multi-judge evaluation (4-model ensemble per PA v5 protocol) - **Effort:** 3-4 days (2d setup, 1-2d analysis + iteration) - **Deps:** H-34 hive-mind extraction complete #### H-43 · LongMemEval benchmark run (LAUNCH GATING) - Same pattern as H-42 - Target: ≥ 93.4% or ≥ Zep 63.8% - **Effort:** 2-3 days - **Deps:** H-42 passes #### H-44 · SWE-ContextBench run (STRATEGIC DIFFERENTIATOR) - Newer benchmark, directly measures context reuse across related tasks - Our strongest architectural fit (bitemporal KG + MPEG-4 I/P/B) - Target: top 3 on memory-configuration track - **Effort:** 3 days - **Deps:** H-34 complete ``` **Update #4 — M-49/M-50 novi items:** ```markdown #### M-49 · KVARK model strategy documentation update - Document Qwen3-30B-A3B-Thinking as KVARK analytical default - Opus 4.7 reserved for multilingual/high-accuracy tier - Reference PA v5 data showing 60x cost-performance advantage - Target file: `docs/KVARK-MODEL-STRATEGY.md` (new) or update to `docs/kvark-http-api-requirements.md` - **Effort:** 2 hours - **Deps:** none #### M-50 · Canonical "cognitive layer" thesis document - File: `docs/THESIS-COGNITIVE-LAYER.md` - 600-800 words, precision framing ("cognitive layer" not "conscious agent") - Three pillars: architecture, empirical validation (PA v5 + benchmarks), real-world test (Claude Code self-use) - Becomes input for launch blog post, pitch deck, Paper 1 intro - **Effort:** 3-4 hours (Claude.ai drafts, Marko reviews) - **Deps:** H-42 results available (so we can reference real numbers) ``` **Update #5 — Critical path rewrite:** Update "Critical path" sekciju backlog-a da reflektuje novi gating model: ``` [M]-01 Stripe products ──┐ ├─► H-26..33 Stripe integration (2d) │ H-01..06 Polish A+B (1.5d) ──┐ │ H-07..10 GEPA wiring (2d) ────┤ │ H-14 Cursor adapter (1d) ──┐ │ ├──► H-11..20 Phase 1 Harvest (3d) exports (done) ────────────┘ │ │ ├──► H-34 hive-mind extraction (5-10d) │ ├──► H-21 Memory Proof (10d) │ └──► H-22 GEPA Proof (18d) ─► H-25 Paper 2 │ H-34 done ───────────────────► H-42 LoCoMo (3-4d) ─── GATE │ [Scenario A/B/C decision] │ ▼ H-43 LongMemEval + H-44 SWE-ContextBench │ ▼ H-35..41 Launch prep ────────► LAUNCH (synchronized) ``` **Longest chain promena:** više nije H-22→H-25 (21d). Sada je **H-34 (5-10d) → H-42 (3-4d) → possible tuning iteration (0-14d) → H-43/H-44 (5d) → H-35..H-41 launch prep (variable)**. Realistic launch timeline 8-10 sedmica. --- ## 4. Tri stvari koje Marko treba da zna iskreno ### 4.1 SOTA gating je strateški hrabro ali rizično Mem0 je organizovan tim koji radi isključivo memoriju preko 2 godine. Njihov novi algoritam postiže 91.6% LoCoMo. Pobediti ih je moguće ali nije garantovano — arhitektonska prednost koju hive-mind ima je realna, ali LoCoMo je ShareGPT-style casual dialogue benchmark gde naša temporal/bitemporal snaga možda nije direktno korisna. Verovatnoća po scenarijima: - **A (≥ 91.6% na prvom pokušaju):** 20-30% - **B (85-91%, tuning može da pomogne):** 40-50% - **C (< 85%, arhitekturni problem):** 20-30% Ovo nisu pesimističke procene, to je iskrena analiza. Ako si spreman na rizik, commit. Ako nisi, razmisli o B-fallback pozicioniranju. ### 4.2 Možeš da pobediš bez "full benchmark SOTA" LoCoMo ima 5 kategorija: single-hop, multi-hop, temporal, open-domain, adversarial. Naša arhitektonska prednost je najjača na **temporal** i **adversarial**. Ako hive-mind pogodi npr. 88% overall, 94% temporal, 96% adversarial — to je legitimno publikovati kao "hive-mind sets new SOTA on temporal reasoning and adversarial subsections of LoCoMo, matches Mem0 on overall score". Less hype, more credible, strateški i dalje jako. ### 4.3 SWE-ContextBench je naše najjače oružje Ovo je noviji benchmark (decembar 2025). mem0 i Supermemory su već evaluirani, ali nije toliko kompetitivno kao LoCoMo. Naša arhitektura je direktno tailorovana za context reuse. **Verovatnoća top-3 finisha ovde: 60-70%.** Ako LoCoMo pokaže samo B, a SWE-ContextBench pokaže top 3 — možeš da launch-uješ sa pozicijom "dominiramo context reuse za coding agents". Za Waggle positioning (consumer agent harness) to je možda jači narrative od LoCoMo SOTA-e. Razmisli o **SWE-ContextBench kao primary launch benchmark** umesto LoCoMo-a. Različita igra, drugačije oružje, veća šansa pobede. --- ## 5. Execution plan za Claude Code — Day 1 Ne menja se bitno od v1. Backlog fundamentals su dobri: 1. **Read this brief v2** (10 min) 2. **Read `docs/research/01-oss-memory-packaging-strategy.md`** (15 min) 3. **Apply backlog updates** iz §3 gore (20 min, mehaničko) 4. **Potvrdi pricing globally** — grep za `$29` i `$79` u docs/, apps/www/, landing page, fix (30 min) 5. **Start H-01 QW-3 skip boot** (30 min code) 6. Nastavi backlog Day 1 sequence Ovo je jednostavan start. Ne treba revolucija — sistem ima puteve, samo ih treba ići. --- ## 6. Šta sam propustio u ovom reconcilier brief-u Iskreno, verovatno nešto. Ova baza znanja u `docs/` je prebogata i neko bi me trebalo da preslušava detaljnije pre nego što konačno potvrdim sve konsistentnosti. Preporuka: Claude Code, dok čitaš ovaj dokument, ako primetiš kontradikciju između mog saveta i nečega konkretnog što vidiš u repo-u, zaustavi se i pitaj. Ne zaobiđi sporne tačke. Konkretno sumnjam da možda postoje stvari u `docs/REMAINING-BACKLOG-2026-04-16.md` ili `docs/TOTAL-WORK-ESTIMATE.md` koje mogu da modificiraju neke ove preporuke. Proveri te dokumente pre nego što komituješ updates u backlog-master.