272 lines
25 KiB
Plaintext
272 lines
25 KiB
Plaintext
# Brief za Claude Code — Reconciliation v2 (sa Marko odlukama)
|
|
|
|
**Autor:** Claude.ai + Marko
|
|
**Datum:** April 18, 2026 (v2 — updated posle Marko odluka)
|
|
**Audience:** Claude Code, radi u `D:\Projects\waggle-os`
|
|
**Status:** UPDATED — ovo supersedira v1 reconciliation brief
|
|
|
|
---
|
|
|
|
## 0. Locked-in odluke (Marko, April 18, 2026)
|
|
|
|
**[M]-11 · Stripe pricing — LOCKED:** Pro $19/mo + Teams $49/seat/mo.
|
|
|
|
**[M]-07 · hive-mind + Waggle launch timing — LOCKED:** Ship TOGETHER, ali launch gated by SOTA benchmark proof. Nema public launch-a bez brojeva koji dokazuju da hive-mind memorijski sistem pobeđuje ili izjednačava sa Mem0 (trenutni SOTA: 91.6% LoCoMo, 93.4% LongMemEval). hive-mind OSS positioning promoviše Waggle product, ali OSS release bez SOTA brojeva ne radi.
|
|
|
|
**[M]-12/13/14 · Ostale Marko decisions:** TBD u sledećim sesijama, ne blokiraju trenutni sprint.
|
|
|
|
**H-34 effort estimate — LOCKED:** koliko treba, toliko. 5-10 dana realno, ne 2-3. Claude Code neka ne skraćuje rad da bi pogodio neku procenu.
|
|
|
|
---
|
|
|
|
## 1. Šta ove odluke znače za backlog
|
|
|
|
### 1.1 Novi critical path
|
|
|
|
Originalni backlog critical path: `H-22 GEPA Proof (18d) → H-25 Paper 2 (3d) = 21 days post-harvest`.
|
|
|
|
Sa [M]-07 odlukom, **pravi critical path postaje benchmark proof, ne papers**:
|
|
|
|
```
|
|
WEEK 1:
|
|
H-01..06 Polish A+B · H-26..33 Stripe · [M]-01 Stripe products
|
|
H-07..10 GEPA wiring closure
|
|
|
|
WEEK 2:
|
|
H-11..20 Harvest Phase 1 (Gemini, Claude, Claude Code, Cursor — ChatGPT waits)
|
|
Start H-34 hive-mind extraction (5-10 dana wall time)
|
|
|
|
WEEK 3-4:
|
|
H-34 hive-mind extraction complete (code migration)
|
|
Start H-42 LoCoMo benchmark run — FIRST ATTEMPT
|
|
H-21 Memory Proof parallel execution
|
|
|
|
WEEK 5:
|
|
LoCoMo result analysis — DECISION POINT
|
|
- Ako ≥ 91.6%: proceed to launch prep
|
|
- Ako 85-91%: tuning iteration, re-run
|
|
- Ako < 85%: architectural investigation, postpone launch discussion
|
|
H-22 GEPA Proof continues (18-day wall time)
|
|
|
|
WEEK 6-7:
|
|
Tuning iterations ako potrebno, ili launch prep (H-35..H-41)
|
|
H-43 LongMemEval + H-44 SWE-ContextBench
|
|
H-23 Combined Proof
|
|
H-24/25 Papers drafting
|
|
|
|
WEEK 8-9:
|
|
Launch prep complete, peer review
|
|
PUBLIC LAUNCH — hive-mind OSS + Waggle beta + papers, sinhronizovano
|
|
|
|
WEEK 10+: fallback ako benchmarks ne pogodili target.
|
|
```
|
|
|
|
**Ključna razlika od v1 brief-a:** launch nije na fiksnom datumu. Launch je gated by LoCoMo/LongMemEval performance. To je hrabrija pozicija ali zahteva strpljenje ako prvi run pokaže 85% umesto 92%.
|
|
|
|
### 1.2 Block H12 benchmark run statusi menjaju
|
|
|
|
U v1 brief-u, predložio sam H-42/43/44 kao **post-Paper-2 polish**. Sa novim [M]-07 odlukom, ovo se potpuno menja:
|
|
|
|
**H-42 · LoCoMo benchmark run (NEW critical-path status):**
|
|
- Pozicija: posle H-34 hive-mind extraction complete, paralelno sa H-21 Memory Proof
|
|
- Ovo je SADA launch gating item, ne nice-to-have
|
|
- Use `snap-research/locomo` harness — no reimplement
|
|
- Run dva konfiga: local (inprocess + Ollama) i frontier (Opus 4.7 answer model)
|
|
- Target: ≥ 91.6% na full benchmark, ili ≥ SOTA na barem jednoj subsekciji (temporal ili adversarial)
|
|
- Effort: 3-4 dana (2 dana setup + 1-2 dana analysis + eventualna iteracija)
|
|
|
|
**H-43 · LongMemEval run (critical-path):**
|
|
- Target: ≥ 93.4% ili barem ≥ Zep-a (63.8%)
|
|
- Effort: 2-3 dana
|
|
|
|
**H-44 · SWE-ContextBench run (strategic-differentiator):**
|
|
- Naš najjači teren arhitekturno
|
|
- Target: top 3
|
|
- Effort: 3 dana
|
|
|
|
### 1.3 Realna pitanja koja treba da postavimo sebi
|
|
|
|
Pre nego što započnemo H-42, vredi da bude jasno šta ćemo da radimo ako:
|
|
|
|
**Scenario A — LoCoMo ≥ 91.6%:** launch sa "new SOTA on LoCoMo" u naslovu. Ovo je idealan slučaj, ali ne garantovan.
|
|
|
|
**Scenario B — LoCoMo 85-91%:** odluka između: (a) tuning iteration (1-2 sedmice rada na hybrid search weights, RRF konstantama, embedding modelu), (b) launch sa "SOTA in local-first category" koji je slabiji ali legitiman, (c) launch sa jednom subkategorijom gde pobeđujemo (temporal reasoning verovatno).
|
|
|
|
**Scenario C — LoCoMo < 85%:** arhitekturna istraga. Možda MPEG-4 I/P/B ne donosi prednost na LoCoMo strukturi (ShareGPT-style casual razgovori nisu teren gde bitemporal pomaže). Postoji legitiman rizik da arhitekturni izbori koji pomažu za Claude Code tipične workload-ove (dugi tehnički konteksti) ne pomažu za LoCoMo casual dialogue strukturu.
|
|
|
|
**Moj iskren savet:** commit-uj Scenario A target, ali mentally prepare za B kao legitimni outcome. Scenario C je manji rizik ali treba da postoji plan.
|
|
|
|
---
|
|
|
|
## 2. Šta se MENJA u v1 brief-u
|
|
|
|
Sve što je u v1 brief-u važi, osim:
|
|
|
|
**Promenjeno:** "ship-before Waggle" → "ship-together sa SOTA gating"
|
|
|
|
**Promenjeno:** timeline "Week 6 hive-mind launch, Week 8 Waggle launch" → "Week 8-9 synchronized launch, gated by benchmark results"
|
|
|
|
**Promenjeno:** pricing $29/$79 → $19/$49 (potvrđeno)
|
|
|
|
**Promenjeno:** H-42/43/44 pozicija u backlog-u — sada critical-path, ne post-polish
|
|
|
|
**Nepromenjeno:** sve ostalo iz v1 ostaje važeće (Qwen3 elevation M-49, canonical thesis M-50, non-duplication sa research serijom, backlog fundamental shape)
|
|
|
|
---
|
|
|
|
## 3. Konkretan update za backlog-master dokument
|
|
|
|
Claude Code treba da uradi sledeće izmene u `docs/plans/BACKLOG-MASTER-2026-04-18.md`:
|
|
|
|
**Update #1 — [M]-11 pricing potvrda:**
|
|
U [M]-01 opisu, potvrditi i fiksirati `$19/mo` i `$49/seat/mo` kao konačne. Global search/replace u `apps/www/` i drugim docs-ovima ako negde piše starije vrednosti.
|
|
|
|
**Update #2 — [M]-07 odluka:**
|
|
U Marko-side queue, ažurirati [M]-07 iz "ship-with or ship-before" u:
|
|
```
|
|
[M]-07 RESOLVED (Apr 18): Ship together, but launch gated by SOTA benchmark proof.
|
|
No public release without LoCoMo ≥ 91.6% or equivalent competitive showing.
|
|
hive-mind OSS launch serves as Waggle launch narrative vehicle.
|
|
```
|
|
|
|
**Update #3 — Novi Block H12 — Public Benchmarks (CRITICAL PATH):**
|
|
Ubaciti posle H11 Auto-updater signing:
|
|
|
|
```markdown
|
|
### Block H12 — Public Benchmark Runs (LAUNCH GATING, 3 items)
|
|
|
|
**These are critical path per [M]-07 decision. Launch is blocked until benchmarks
|
|
validate architectural claims against current SOTA.**
|
|
|
|
#### H-42 · LoCoMo benchmark run (LAUNCH GATING)
|
|
- Use snap-research/locomo evaluation harness, do not reimplement
|
|
- Run two configs: local (inprocess + Ollama) and frontier (Opus 4.7 answer model)
|
|
- Target: ≥ 91.6% full benchmark OR ≥ SOTA on temporal/adversarial subsection
|
|
- Commit full raw outputs + analysis to `docs/results/LOCOMO-RESULTS.md`
|
|
- **Verify:** multi-judge evaluation (4-model ensemble per PA v5 protocol)
|
|
- **Effort:** 3-4 days (2d setup, 1-2d analysis + iteration)
|
|
- **Deps:** H-34 hive-mind extraction complete
|
|
|
|
#### H-43 · LongMemEval benchmark run (LAUNCH GATING)
|
|
- Same pattern as H-42
|
|
- Target: ≥ 93.4% or ≥ Zep 63.8%
|
|
- **Effort:** 2-3 days
|
|
- **Deps:** H-42 passes
|
|
|
|
#### H-44 · SWE-ContextBench run (STRATEGIC DIFFERENTIATOR)
|
|
- Newer benchmark, directly measures context reuse across related tasks
|
|
- Our strongest architectural fit (bitemporal KG + MPEG-4 I/P/B)
|
|
- Target: top 3 on memory-configuration track
|
|
- **Effort:** 3 days
|
|
- **Deps:** H-34 complete
|
|
```
|
|
|
|
**Update #4 — M-49/M-50 novi items:**
|
|
|
|
```markdown
|
|
#### M-49 · KVARK model strategy documentation update
|
|
- Document Qwen3-30B-A3B-Thinking as KVARK analytical default
|
|
- Opus 4.7 reserved for multilingual/high-accuracy tier
|
|
- Reference PA v5 data showing 60x cost-performance advantage
|
|
- Target file: `docs/KVARK-MODEL-STRATEGY.md` (new) or update to
|
|
`docs/kvark-http-api-requirements.md`
|
|
- **Effort:** 2 hours
|
|
- **Deps:** none
|
|
|
|
#### M-50 · Canonical "cognitive layer" thesis document
|
|
- File: `docs/THESIS-COGNITIVE-LAYER.md`
|
|
- 600-800 words, precision framing ("cognitive layer" not "conscious agent")
|
|
- Three pillars: architecture, empirical validation (PA v5 + benchmarks),
|
|
real-world test (Claude Code self-use)
|
|
- Becomes input for launch blog post, pitch deck, Paper 1 intro
|
|
- **Effort:** 3-4 hours (Claude.ai drafts, Marko reviews)
|
|
- **Deps:** H-42 results available (so we can reference real numbers)
|
|
```
|
|
|
|
**Update #5 — Critical path rewrite:**
|
|
Update "Critical path" sekciju backlog-a da reflektuje novi gating model:
|
|
|
|
```
|
|
[M]-01 Stripe products ──┐
|
|
├─► H-26..33 Stripe integration (2d)
|
|
│
|
|
H-01..06 Polish A+B (1.5d) ──┐
|
|
│
|
|
H-07..10 GEPA wiring (2d) ────┤
|
|
│
|
|
H-14 Cursor adapter (1d) ──┐ │
|
|
├──► H-11..20 Phase 1 Harvest (3d)
|
|
exports (done) ────────────┘ │
|
|
│
|
|
├──► H-34 hive-mind extraction (5-10d)
|
|
│
|
|
├──► H-21 Memory Proof (10d)
|
|
│
|
|
└──► H-22 GEPA Proof (18d) ─► H-25 Paper 2
|
|
│
|
|
H-34 done ───────────────────► H-42 LoCoMo (3-4d) ─── GATE
|
|
│
|
|
[Scenario A/B/C decision]
|
|
│
|
|
▼
|
|
H-43 LongMemEval + H-44 SWE-ContextBench
|
|
│
|
|
▼
|
|
H-35..41 Launch prep ────────► LAUNCH (synchronized)
|
|
```
|
|
|
|
**Longest chain promena:** više nije H-22→H-25 (21d). Sada je **H-34 (5-10d) → H-42 (3-4d) → possible tuning iteration (0-14d) → H-43/H-44 (5d) → H-35..H-41 launch prep (variable)**. Realistic launch timeline 8-10 sedmica.
|
|
|
|
---
|
|
|
|
## 4. Tri stvari koje Marko treba da zna iskreno
|
|
|
|
### 4.1 SOTA gating je strateški hrabro ali rizično
|
|
|
|
Mem0 je organizovan tim koji radi isključivo memoriju preko 2 godine. Njihov novi algoritam postiže 91.6% LoCoMo. Pobediti ih je moguće ali nije garantovano — arhitektonska prednost koju hive-mind ima je realna, ali LoCoMo je ShareGPT-style casual dialogue benchmark gde naša temporal/bitemporal snaga možda nije direktno korisna.
|
|
|
|
Verovatnoća po scenarijima:
|
|
- **A (≥ 91.6% na prvom pokušaju):** 20-30%
|
|
- **B (85-91%, tuning može da pomogne):** 40-50%
|
|
- **C (< 85%, arhitekturni problem):** 20-30%
|
|
|
|
Ovo nisu pesimističke procene, to je iskrena analiza. Ako si spreman na rizik, commit. Ako nisi, razmisli o B-fallback pozicioniranju.
|
|
|
|
### 4.2 Možeš da pobediš bez "full benchmark SOTA"
|
|
|
|
LoCoMo ima 5 kategorija: single-hop, multi-hop, temporal, open-domain, adversarial. Naša arhitektonska prednost je najjača na **temporal** i **adversarial**.
|
|
|
|
Ako hive-mind pogodi npr. 88% overall, 94% temporal, 96% adversarial — to je legitimno publikovati kao "hive-mind sets new SOTA on temporal reasoning and adversarial subsections of LoCoMo, matches Mem0 on overall score". Less hype, more credible, strateški i dalje jako.
|
|
|
|
### 4.3 SWE-ContextBench je naše najjače oružje
|
|
|
|
Ovo je noviji benchmark (decembar 2025). mem0 i Supermemory su već evaluirani, ali nije toliko kompetitivno kao LoCoMo. Naša arhitektura je direktno tailorovana za context reuse. **Verovatnoća top-3 finisha ovde: 60-70%.**
|
|
|
|
Ako LoCoMo pokaže samo B, a SWE-ContextBench pokaže top 3 — možeš da launch-uješ sa pozicijom "dominiramo context reuse za coding agents". Za Waggle positioning (consumer agent harness) to je možda jači narrative od LoCoMo SOTA-e.
|
|
|
|
Razmisli o **SWE-ContextBench kao primary launch benchmark** umesto LoCoMo-a. Različita igra, drugačije oružje, veća šansa pobede.
|
|
|
|
---
|
|
|
|
## 5. Execution plan za Claude Code — Day 1
|
|
|
|
Ne menja se bitno od v1. Backlog fundamentals su dobri:
|
|
|
|
1. **Read this brief v2** (10 min)
|
|
2. **Read `docs/research/01-oss-memory-packaging-strategy.md`** (15 min)
|
|
3. **Apply backlog updates** iz §3 gore (20 min, mehaničko)
|
|
4. **Potvrdi pricing globally** — grep za `$29` i `$79` u docs/, apps/www/, landing page, fix (30 min)
|
|
5. **Start H-01 QW-3 skip boot** (30 min code)
|
|
6. Nastavi backlog Day 1 sequence
|
|
|
|
Ovo je jednostavan start. Ne treba revolucija — sistem ima puteve, samo ih treba ići.
|
|
|
|
---
|
|
|
|
## 6. Šta sam propustio u ovom reconcilier brief-u
|
|
|
|
Iskreno, verovatno nešto. Ova baza znanja u `docs/` je prebogata i neko bi me trebalo da preslušava detaljnije pre nego što konačno potvrdim sve konsistentnosti. Preporuka: Claude Code, dok čitaš ovaj dokument, ako primetiš kontradikciju između mog saveta i nečega konkretnog što vidiš u repo-u, zaustavi se i pitaj. Ne zaobiđi sporne tačke.
|
|
|
|
Konkretno sumnjam da možda postoje stvari u `docs/REMAINING-BACKLOG-2026-04-16.md` ili `docs/TOTAL-WORK-ESTIMATE.md` koje mogu da modificiraju neke ove preporuke. Proveri te dokumente pre nego što komituješ updates u backlog-master.
|
|
|