moving
Some checks failed
Installer Smoke / installer-smoke (push) Has been cancelled

This commit is contained in:
Oleg Maslov
2026-09-02 10:10:29 +02:00
commit 0c3e2ead3b
3841 changed files with 970576 additions and 0 deletions

View File

@@ -0,0 +1,92 @@
# Handoff za Claude Code — 2026-04-19
**Od:** Marko (preko PM agenta)
**Cilj:** Claude Code zatvara Polish + standing pool dok PM agent radi engineering audit paralelno.
---
## Šta je odlučeno (LOCKED 2026-04-19)
Tri-track sekvenca do launch-a. Detalji u `decisions/2026-04-19-tracks-sequencing-locked.md`.
**Track 1 (tvoj zadatak sad):** Polish + standing pool, blocker za Track 2.
**Track 2 (kreće posle Track 1 + audit):** Tri benchmarka paralelno.
**Track 3 (paralelno sa Track 2):** UI/UX + e2e.
Target model za ceo stack je sad **Qwen/Qwen3.6-35B-A3B** (LOCKED + VERIFIED 2026-04-19, HF model card: https://huggingface.co/Qwen/Qwen3.6-35B-A3B). Specifikacije relevantne za nas: 35B total / 3B active MoE, Apache-2.0, native 262K context (YaRN do 1M), thinking mode default ON (toggle off via `enable_thinking: false`), vLLM 0.19.0+ preporučen sa komandom `vllm serve Qwen/Qwen3.6-35B-A3B --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3` (mapira direktno na LM TEK H200 x8). Standalone benchmark baselines: SWE-bench Verified 73.4, AIME 2026 92.7, MMLU-Pro 85.2, GPQA Diamond 86.0. Ovo zamenjuje prethodni KVARK LOCKED Qwen3-30B-A3B-Thinking i backlog default Gemma 4 31B.
**Launch narrative implikacija:** Qwen3.6-35B-A3B je već u Opus-class na većini benchmark-a sa 3B aktivnih params. NE forsirati "small beats big" formulaciju. Pravilna formulacija je "održavamo Opus-class capability lokalno, sa našom memorijom kao multipler za long-term continuity". H-44 SWE-CB mora premašiti standalone 73.4 — target 78+ za defensive lift, 80+ za strong headline.
---
## Konkretan rad — Track 1
### Phase A+B (prvi prioritet, ~6-8h)
Zatvori H-01..H-06 (6 stavki). Po zatvaranju, H-35 binary smoke test je ready — pokreni ga i potvrdi zelenu boju.
### Standing pool (posle Phase A+B, prema prioritetu)
- **~35 HIGH** — polish close + proofs + papers prep + launch prep
- **~50 MEDIUM** — per backlog prioritet
- **~22 LOW** — per backlog prioritet
**Eksplicitno isključeno:** Harvest adapter stream. Harvest ostaje PARKED do post-launch per arhitekturna odluka (vidi `project_harvest_parity_stream.md` u memoriji). Ne diraj harvest u ovom prolazku.
---
## Šta dolazi posle Polish (čekaj instrukcije)
### Engineering audit (PM agent radi paralelno)
Dok ti radiš Polish, PM agent radi cross-cut engineering audit oba repo-a (waggle-os puni + hive-mind release health). Audit deliverable je `briefs/2026-04-19-engineering-audit-pre-benchmark.md`. Iz audit-a će izaći **dodatne H-XX stavke** koje ulaze u Track 1 kao "must fix before benchmark". Ne kreći Track 2 dok audit nalazi ne uđu u backlog i ne budu zatvoreni.
### Track 2 (čekaj zelenu)
Kad Polish + audit fix-evi padnu, kreće Track 2:
- **H-42 LoCoMo** na hive-mind repo-u (memory recall, target ≥91.6% Mem0 SOTA)
- **H-43 LongMemEval** na waggle-os repo-u (agent long-term memory, Letta baseline ~83%)
- **H-44 SWE-ContextBench** na waggle-os repo-u (verovatnoća top-3: 60-70%)
Sva tri istovremeno, isti engine (Qwen/Qwen3.6-35B-A3B), isti judge ensemble.
### Judge ensemble specifikacija
Iz V5 PA testova, validiran metodološki (judge disagreement < 0.25):
- gemini-3.1-pro-preview
- gpt-5
- grok-4.20
- MiniMax-M2.7
**Bez Anthropic modela u judge ensemble-u** — vendor circularity guard. Ne mešati Anthropic među evaluatorima jer sami ćemo verovatno koristiti Anthropic modele negde u stack-u.
### Track 3 (paralelno sa Track 2)
UI/UX peglanje + e2e test scenariji. Marko će igrati ulogu user-a u browser-u prema persona skriptama, PM agent priprema friction log. Track 3 ne blokira Track 2.
---
## Launch copy anchor (za Track 2 output)
Kad benchmark rezultati dođu, launch copy headline kandidate su:
- **Verifikovano već (V5 H1 PASS):** "PromptAssembler verified to lift Opus 4.6 by +5.2pp across 5/6 scenarios (4-judge ensemble, no vendor circularity)" — ovo je tvoj publishable anchor bez obzira na benchmark ishod.
- **Pending Track 2 brojeva:** "Memory layer matches/exceeds Mem0 SOTA on LoCoMo", "Competitive with leading agent memory frameworks on LongMemEval", "Top-N on SWE-ContextBench"
Konkretni headline brojevi izlaze iz Track 2. Track 3 paralelno priprema demo + screenshot + video kapital.
**Ne forsirati u headline:** Qwen analitički scaffold (V5 H2 narrow win, max 7.4pp na 1/2 scenarija), compression closure (V5 H3 fail, 5.0% mean closure). Te dve hipoteze su naučni nalazi, ne marketing materijal.
---
## Sledeći komunikacioni cycle
1. Ti potvrdi prijem ovog handoff-a i krećeš Polish A+B
2. Ja krećem engineering audit paralelno
3. Kad imam audit nalaze za "must fix before benchmark" kategoriju, stavljam ih u backlog kao formalne H-XX
4. Ti zatvaraš te dodatne stavke kao deo Track 1
5. Kad Track 1 padne, daješ mi green-light za Track 2 spec finalizaciju
6. Track 2 i Track 3 kreću zajedno
Ako naletneš na blocker u Polish-u koji nije tehnički već strateški, eskaliraj odmah preko PM agenta — ne čekaj.