Files
waggle-os/docs/briefs/2026-04-19-handoff-claude-code.md
Oleg Maslov 0c3e2ead3b
Some checks failed
Installer Smoke / installer-smoke (push) Has been cancelled
moving
2026-09-02 10:10:29 +02:00

93 lines
4.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Handoff za Claude Code — 2026-04-19
**Od:** Marko (preko PM agenta)
**Cilj:** Claude Code zatvara Polish + standing pool dok PM agent radi engineering audit paralelno.
---
## Šta je odlučeno (LOCKED 2026-04-19)
Tri-track sekvenca do launch-a. Detalji u `decisions/2026-04-19-tracks-sequencing-locked.md`.
**Track 1 (tvoj zadatak sad):** Polish + standing pool, blocker za Track 2.
**Track 2 (kreće posle Track 1 + audit):** Tri benchmarka paralelno.
**Track 3 (paralelno sa Track 2):** UI/UX + e2e.
Target model za ceo stack je sad **Qwen/Qwen3.6-35B-A3B** (LOCKED + VERIFIED 2026-04-19, HF model card: https://huggingface.co/Qwen/Qwen3.6-35B-A3B). Specifikacije relevantne za nas: 35B total / 3B active MoE, Apache-2.0, native 262K context (YaRN do 1M), thinking mode default ON (toggle off via `enable_thinking: false`), vLLM 0.19.0+ preporučen sa komandom `vllm serve Qwen/Qwen3.6-35B-A3B --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3` (mapira direktno na LM TEK H200 x8). Standalone benchmark baselines: SWE-bench Verified 73.4, AIME 2026 92.7, MMLU-Pro 85.2, GPQA Diamond 86.0. Ovo zamenjuje prethodni KVARK LOCKED Qwen3-30B-A3B-Thinking i backlog default Gemma 4 31B.
**Launch narrative implikacija:** Qwen3.6-35B-A3B je već u Opus-class na većini benchmark-a sa 3B aktivnih params. NE forsirati "small beats big" formulaciju. Pravilna formulacija je "održavamo Opus-class capability lokalno, sa našom memorijom kao multipler za long-term continuity". H-44 SWE-CB mora premašiti standalone 73.4 — target 78+ za defensive lift, 80+ za strong headline.
---
## Konkretan rad — Track 1
### Phase A+B (prvi prioritet, ~6-8h)
Zatvori H-01..H-06 (6 stavki). Po zatvaranju, H-35 binary smoke test je ready — pokreni ga i potvrdi zelenu boju.
### Standing pool (posle Phase A+B, prema prioritetu)
- **~35 HIGH** — polish close + proofs + papers prep + launch prep
- **~50 MEDIUM** — per backlog prioritet
- **~22 LOW** — per backlog prioritet
**Eksplicitno isključeno:** Harvest adapter stream. Harvest ostaje PARKED do post-launch per arhitekturna odluka (vidi `project_harvest_parity_stream.md` u memoriji). Ne diraj harvest u ovom prolazku.
---
## Šta dolazi posle Polish (čekaj instrukcije)
### Engineering audit (PM agent radi paralelno)
Dok ti radiš Polish, PM agent radi cross-cut engineering audit oba repo-a (waggle-os puni + hive-mind release health). Audit deliverable je `briefs/2026-04-19-engineering-audit-pre-benchmark.md`. Iz audit-a će izaći **dodatne H-XX stavke** koje ulaze u Track 1 kao "must fix before benchmark". Ne kreći Track 2 dok audit nalazi ne uđu u backlog i ne budu zatvoreni.
### Track 2 (čekaj zelenu)
Kad Polish + audit fix-evi padnu, kreće Track 2:
- **H-42 LoCoMo** na hive-mind repo-u (memory recall, target ≥91.6% Mem0 SOTA)
- **H-43 LongMemEval** na waggle-os repo-u (agent long-term memory, Letta baseline ~83%)
- **H-44 SWE-ContextBench** na waggle-os repo-u (verovatnoća top-3: 60-70%)
Sva tri istovremeno, isti engine (Qwen/Qwen3.6-35B-A3B), isti judge ensemble.
### Judge ensemble specifikacija
Iz V5 PA testova, validiran metodološki (judge disagreement < 0.25):
- gemini-3.1-pro-preview
- gpt-5
- grok-4.20
- MiniMax-M2.7
**Bez Anthropic modela u judge ensemble-u** — vendor circularity guard. Ne mešati Anthropic među evaluatorima jer sami ćemo verovatno koristiti Anthropic modele negde u stack-u.
### Track 3 (paralelno sa Track 2)
UI/UX peglanje + e2e test scenariji. Marko će igrati ulogu user-a u browser-u prema persona skriptama, PM agent priprema friction log. Track 3 ne blokira Track 2.
---
## Launch copy anchor (za Track 2 output)
Kad benchmark rezultati dođu, launch copy headline kandidate su:
- **Verifikovano već (V5 H1 PASS):** "PromptAssembler verified to lift Opus 4.6 by +5.2pp across 5/6 scenarios (4-judge ensemble, no vendor circularity)" — ovo je tvoj publishable anchor bez obzira na benchmark ishod.
- **Pending Track 2 brojeva:** "Memory layer matches/exceeds Mem0 SOTA on LoCoMo", "Competitive with leading agent memory frameworks on LongMemEval", "Top-N on SWE-ContextBench"
Konkretni headline brojevi izlaze iz Track 2. Track 3 paralelno priprema demo + screenshot + video kapital.
**Ne forsirati u headline:** Qwen analitički scaffold (V5 H2 narrow win, max 7.4pp na 1/2 scenarija), compression closure (V5 H3 fail, 5.0% mean closure). Te dve hipoteze su naučni nalazi, ne marketing materijal.
---
## Sledeći komunikacioni cycle
1. Ti potvrdi prijem ovog handoff-a i krećeš Polish A+B
2. Ja krećem engineering audit paralelno
3. Kad imam audit nalaze za "must fix before benchmark" kategoriju, stavljam ih u backlog kao formalne H-XX
4. Ti zatvaraš te dodatne stavke kao deo Track 1
5. Kad Track 1 padne, daješ mi green-light za Track 2 spec finalizaciju
6. Track 2 i Track 3 kreću zajedno
Ako naletneš na blocker u Polish-u koji nije tehnički već strateški, eskaliraj odmah preko PM agenta — ne čekaj.