Files
waggle-os/docs/briefs/WAGGLE-RECONCILIATION-BRIEF-V2.txt
Oleg Maslov 0c3e2ead3b
Some checks failed
Installer Smoke / installer-smoke (push) Has been cancelled
moving
2026-09-02 10:10:29 +02:00

272 lines
25 KiB
Plaintext

# Brief za Claude Code — Reconciliation v2 (sa Marko odlukama)
**Autor:** Claude.ai + Marko
**Datum:** April 18, 2026 (v2 — updated posle Marko odluka)
**Audience:** Claude Code, radi u `D:\Projects\waggle-os`
**Status:** UPDATED — ovo supersedira v1 reconciliation brief
---
## 0. Locked-in odluke (Marko, April 18, 2026)
**[M]-11 · Stripe pricing — LOCKED:** Pro $19/mo + Teams $49/seat/mo.
**[M]-07 · hive-mind + Waggle launch timing — LOCKED:** Ship TOGETHER, ali launch gated by SOTA benchmark proof. Nema public launch-a bez brojeva koji dokazuju da hive-mind memorijski sistem pobeđuje ili izjednačava sa Mem0 (trenutni SOTA: 91.6% LoCoMo, 93.4% LongMemEval). hive-mind OSS positioning promoviše Waggle product, ali OSS release bez SOTA brojeva ne radi.
**[M]-12/13/14 · Ostale Marko decisions:** TBD u sledećim sesijama, ne blokiraju trenutni sprint.
**H-34 effort estimate — LOCKED:** koliko treba, toliko. 5-10 dana realno, ne 2-3. Claude Code neka ne skraćuje rad da bi pogodio neku procenu.
---
## 1. Šta ove odluke znače za backlog
### 1.1 Novi critical path
Originalni backlog critical path: `H-22 GEPA Proof (18d) → H-25 Paper 2 (3d) = 21 days post-harvest`.
Sa [M]-07 odlukom, **pravi critical path postaje benchmark proof, ne papers**:
```
WEEK 1:
H-01..06 Polish A+B · H-26..33 Stripe · [M]-01 Stripe products
H-07..10 GEPA wiring closure
WEEK 2:
H-11..20 Harvest Phase 1 (Gemini, Claude, Claude Code, Cursor — ChatGPT waits)
Start H-34 hive-mind extraction (5-10 dana wall time)
WEEK 3-4:
H-34 hive-mind extraction complete (code migration)
Start H-42 LoCoMo benchmark run — FIRST ATTEMPT
H-21 Memory Proof parallel execution
WEEK 5:
LoCoMo result analysis — DECISION POINT
- Ako ≥ 91.6%: proceed to launch prep
- Ako 85-91%: tuning iteration, re-run
- Ako < 85%: architectural investigation, postpone launch discussion
H-22 GEPA Proof continues (18-day wall time)
WEEK 6-7:
Tuning iterations ako potrebno, ili launch prep (H-35..H-41)
H-43 LongMemEval + H-44 SWE-ContextBench
H-23 Combined Proof
H-24/25 Papers drafting
WEEK 8-9:
Launch prep complete, peer review
PUBLIC LAUNCH — hive-mind OSS + Waggle beta + papers, sinhronizovano
WEEK 10+: fallback ako benchmarks ne pogodili target.
```
**Ključna razlika od v1 brief-a:** launch nije na fiksnom datumu. Launch je gated by LoCoMo/LongMemEval performance. To je hrabrija pozicija ali zahteva strpljenje ako prvi run pokaže 85% umesto 92%.
### 1.2 Block H12 benchmark run statusi menjaju
U v1 brief-u, predložio sam H-42/43/44 kao **post-Paper-2 polish**. Sa novim [M]-07 odlukom, ovo se potpuno menja:
**H-42 · LoCoMo benchmark run (NEW critical-path status):**
- Pozicija: posle H-34 hive-mind extraction complete, paralelno sa H-21 Memory Proof
- Ovo je SADA launch gating item, ne nice-to-have
- Use `snap-research/locomo` harness — no reimplement
- Run dva konfiga: local (inprocess + Ollama) i frontier (Opus 4.7 answer model)
- Target: ≥ 91.6% na full benchmark, ili ≥ SOTA na barem jednoj subsekciji (temporal ili adversarial)
- Effort: 3-4 dana (2 dana setup + 1-2 dana analysis + eventualna iteracija)
**H-43 · LongMemEval run (critical-path):**
- Target: ≥ 93.4% ili barem ≥ Zep-a (63.8%)
- Effort: 2-3 dana
**H-44 · SWE-ContextBench run (strategic-differentiator):**
- Naš najjači teren arhitekturno
- Target: top 3
- Effort: 3 dana
### 1.3 Realna pitanja koja treba da postavimo sebi
Pre nego što započnemo H-42, vredi da bude jasno šta ćemo da radimo ako:
**Scenario A — LoCoMo ≥ 91.6%:** launch sa "new SOTA on LoCoMo" u naslovu. Ovo je idealan slučaj, ali ne garantovan.
**Scenario B — LoCoMo 85-91%:** odluka između: (a) tuning iteration (1-2 sedmice rada na hybrid search weights, RRF konstantama, embedding modelu), (b) launch sa "SOTA in local-first category" koji je slabiji ali legitiman, (c) launch sa jednom subkategorijom gde pobeđujemo (temporal reasoning verovatno).
**Scenario C — LoCoMo < 85%:** arhitekturna istraga. Možda MPEG-4 I/P/B ne donosi prednost na LoCoMo strukturi (ShareGPT-style casual razgovori nisu teren gde bitemporal pomaže). Postoji legitiman rizik da arhitekturni izbori koji pomažu za Claude Code tipične workload-ove (dugi tehnički konteksti) ne pomažu za LoCoMo casual dialogue strukturu.
**Moj iskren savet:** commit-uj Scenario A target, ali mentally prepare za B kao legitimni outcome. Scenario C je manji rizik ali treba da postoji plan.
---
## 2. Šta se MENJA u v1 brief-u
Sve što je u v1 brief-u važi, osim:
**Promenjeno:** "ship-before Waggle" → "ship-together sa SOTA gating"
**Promenjeno:** timeline "Week 6 hive-mind launch, Week 8 Waggle launch" → "Week 8-9 synchronized launch, gated by benchmark results"
**Promenjeno:** pricing $29/$79 → $19/$49 (potvrđeno)
**Promenjeno:** H-42/43/44 pozicija u backlog-u — sada critical-path, ne post-polish
**Nepromenjeno:** sve ostalo iz v1 ostaje važeće (Qwen3 elevation M-49, canonical thesis M-50, non-duplication sa research serijom, backlog fundamental shape)
---
## 3. Konkretan update za backlog-master dokument
Claude Code treba da uradi sledeće izmene u `docs/plans/BACKLOG-MASTER-2026-04-18.md`:
**Update #1 — [M]-11 pricing potvrda:**
U [M]-01 opisu, potvrditi i fiksirati `$19/mo` i `$49/seat/mo` kao konačne. Global search/replace u `apps/www/` i drugim docs-ovima ako negde piše starije vrednosti.
**Update #2 — [M]-07 odluka:**
U Marko-side queue, ažurirati [M]-07 iz "ship-with or ship-before" u:
```
[M]-07 RESOLVED (Apr 18): Ship together, but launch gated by SOTA benchmark proof.
No public release without LoCoMo ≥ 91.6% or equivalent competitive showing.
hive-mind OSS launch serves as Waggle launch narrative vehicle.
```
**Update #3 — Novi Block H12 — Public Benchmarks (CRITICAL PATH):**
Ubaciti posle H11 Auto-updater signing:
```markdown
### Block H12 — Public Benchmark Runs (LAUNCH GATING, 3 items)
**These are critical path per [M]-07 decision. Launch is blocked until benchmarks
validate architectural claims against current SOTA.**
#### H-42 · LoCoMo benchmark run (LAUNCH GATING)
- Use snap-research/locomo evaluation harness, do not reimplement
- Run two configs: local (inprocess + Ollama) and frontier (Opus 4.7 answer model)
- Target: ≥ 91.6% full benchmark OR ≥ SOTA on temporal/adversarial subsection
- Commit full raw outputs + analysis to `docs/results/LOCOMO-RESULTS.md`
- **Verify:** multi-judge evaluation (4-model ensemble per PA v5 protocol)
- **Effort:** 3-4 days (2d setup, 1-2d analysis + iteration)
- **Deps:** H-34 hive-mind extraction complete
#### H-43 · LongMemEval benchmark run (LAUNCH GATING)
- Same pattern as H-42
- Target: ≥ 93.4% or ≥ Zep 63.8%
- **Effort:** 2-3 days
- **Deps:** H-42 passes
#### H-44 · SWE-ContextBench run (STRATEGIC DIFFERENTIATOR)
- Newer benchmark, directly measures context reuse across related tasks
- Our strongest architectural fit (bitemporal KG + MPEG-4 I/P/B)
- Target: top 3 on memory-configuration track
- **Effort:** 3 days
- **Deps:** H-34 complete
```
**Update #4 — M-49/M-50 novi items:**
```markdown
#### M-49 · KVARK model strategy documentation update
- Document Qwen3-30B-A3B-Thinking as KVARK analytical default
- Opus 4.7 reserved for multilingual/high-accuracy tier
- Reference PA v5 data showing 60x cost-performance advantage
- Target file: `docs/KVARK-MODEL-STRATEGY.md` (new) or update to
`docs/kvark-http-api-requirements.md`
- **Effort:** 2 hours
- **Deps:** none
#### M-50 · Canonical "cognitive layer" thesis document
- File: `docs/THESIS-COGNITIVE-LAYER.md`
- 600-800 words, precision framing ("cognitive layer" not "conscious agent")
- Three pillars: architecture, empirical validation (PA v5 + benchmarks),
real-world test (Claude Code self-use)
- Becomes input for launch blog post, pitch deck, Paper 1 intro
- **Effort:** 3-4 hours (Claude.ai drafts, Marko reviews)
- **Deps:** H-42 results available (so we can reference real numbers)
```
**Update #5 — Critical path rewrite:**
Update "Critical path" sekciju backlog-a da reflektuje novi gating model:
```
[M]-01 Stripe products ──┐
├─► H-26..33 Stripe integration (2d)
H-01..06 Polish A+B (1.5d) ──┐
H-07..10 GEPA wiring (2d) ────┤
H-14 Cursor adapter (1d) ──┐ │
├──► H-11..20 Phase 1 Harvest (3d)
exports (done) ────────────┘ │
├──► H-34 hive-mind extraction (5-10d)
├──► H-21 Memory Proof (10d)
└──► H-22 GEPA Proof (18d) ─► H-25 Paper 2
H-34 done ───────────────────► H-42 LoCoMo (3-4d) ─── GATE
[Scenario A/B/C decision]
H-43 LongMemEval + H-44 SWE-ContextBench
H-35..41 Launch prep ────────► LAUNCH (synchronized)
```
**Longest chain promena:** više nije H-22→H-25 (21d). Sada je **H-34 (5-10d) → H-42 (3-4d) → possible tuning iteration (0-14d) → H-43/H-44 (5d) → H-35..H-41 launch prep (variable)**. Realistic launch timeline 8-10 sedmica.
---
## 4. Tri stvari koje Marko treba da zna iskreno
### 4.1 SOTA gating je strateški hrabro ali rizično
Mem0 je organizovan tim koji radi isključivo memoriju preko 2 godine. Njihov novi algoritam postiže 91.6% LoCoMo. Pobediti ih je moguće ali nije garantovano — arhitektonska prednost koju hive-mind ima je realna, ali LoCoMo je ShareGPT-style casual dialogue benchmark gde naša temporal/bitemporal snaga možda nije direktno korisna.
Verovatnoća po scenarijima:
- **A (≥ 91.6% na prvom pokušaju):** 20-30%
- **B (85-91%, tuning može da pomogne):** 40-50%
- **C (< 85%, arhitekturni problem):** 20-30%
Ovo nisu pesimističke procene, to je iskrena analiza. Ako si spreman na rizik, commit. Ako nisi, razmisli o B-fallback pozicioniranju.
### 4.2 Možeš da pobediš bez "full benchmark SOTA"
LoCoMo ima 5 kategorija: single-hop, multi-hop, temporal, open-domain, adversarial. Naša arhitektonska prednost je najjača na **temporal** i **adversarial**.
Ako hive-mind pogodi npr. 88% overall, 94% temporal, 96% adversarial — to je legitimno publikovati kao "hive-mind sets new SOTA on temporal reasoning and adversarial subsections of LoCoMo, matches Mem0 on overall score". Less hype, more credible, strateški i dalje jako.
### 4.3 SWE-ContextBench je naše najjače oružje
Ovo je noviji benchmark (decembar 2025). mem0 i Supermemory su već evaluirani, ali nije toliko kompetitivno kao LoCoMo. Naša arhitektura je direktno tailorovana za context reuse. **Verovatnoća top-3 finisha ovde: 60-70%.**
Ako LoCoMo pokaže samo B, a SWE-ContextBench pokaže top 3 — možeš da launch-uješ sa pozicijom "dominiramo context reuse za coding agents". Za Waggle positioning (consumer agent harness) to je možda jači narrative od LoCoMo SOTA-e.
Razmisli o **SWE-ContextBench kao primary launch benchmark** umesto LoCoMo-a. Različita igra, drugačije oružje, veća šansa pobede.
---
## 5. Execution plan za Claude Code — Day 1
Ne menja se bitno od v1. Backlog fundamentals su dobri:
1. **Read this brief v2** (10 min)
2. **Read `docs/research/01-oss-memory-packaging-strategy.md`** (15 min)
3. **Apply backlog updates** iz §3 gore (20 min, mehaničko)
4. **Potvrdi pricing globally** — grep za `$29` i `$79` u docs/, apps/www/, landing page, fix (30 min)
5. **Start H-01 QW-3 skip boot** (30 min code)
6. Nastavi backlog Day 1 sequence
Ovo je jednostavan start. Ne treba revolucija — sistem ima puteve, samo ih treba ići.
---
## 6. Šta sam propustio u ovom reconcilier brief-u
Iskreno, verovatno nešto. Ova baza znanja u `docs/` je prebogata i neko bi me trebalo da preslušava detaljnije pre nego što konačno potvrdim sve konsistentnosti. Preporuka: Claude Code, dok čitaš ovaj dokument, ako primetiš kontradikciju između mog saveta i nečega konkretnog što vidiš u repo-u, zaustavi se i pitaj. Ne zaobiđi sporne tačke.
Konkretno sumnjam da možda postoje stvari u `docs/REMAINING-BACKLOG-2026-04-16.md` ili `docs/TOTAL-WORK-ESTIMATE.md` koje mogu da modificiraju neke ove preporuke. Proveri te dokumente pre nego što komituješ updates u backlog-master.