Ruimtemeesters
Roadmap9/12 gemeten

Wat we bouwen, en waarom

Deze nieuwsbrief dient één ding: actueel blijven. Alles hieronder hangt aan SPOOR-11 — Signalering.

Elk punt vermeldt waaróp het rust. Gemeten betekent dat er een getal uit deze repo achter zit en dat het getal erbij staat. Afgeleid betekent: geredeneerd vanuit zulke getallen, maar de oplossing zelf is nog onbewezen. Aanname is een keuze — die mag je bestrijden. Zonder dat onderscheid leest een roadmap als een verlanglijst, en verlanglijstjes leveren werk op dat achteraf niemand kan verantwoorden.

Cockpit noteert Spoor 11 als "Nieuwsbrief; volle breedte nog te bouwen"; er hingen nog geen werkitems onder. Laatst herzien: 2026-08-11.

Nu

Aan het werk, of net af.
  • Scoringspijplijn hersteld

    AfGemeten

    De feed vult zich weer en de dagelijkse mail vertrekt.

    De pijplijn stond 20 dagen stil (22 juli – 11 augustus) door twee onafhankelijke credential-fouten: een verlopen Cursor-token en een opgebruikt metered Anthropic-tegoed. Alle stappen scoorden 0. Backfill: 339 teamscores, 409 importance, 409 milieu, 0 fouten; snapshot weer op 420 uitspraken.

    SPOOR-11PR #289
  • Stille storingen worden gemeld

    AfGemeten

    Een kapotte nacht levert een mail op, geen stilte.

    Stap 2–9 zijn bewust niet-fataal, dus de unit eindigde 20 dagen lang met exit 0 terwijl er niets werd gescoord. Alle signalen stonden al in data/ingest-status.json; niemand las ze. Watchdog draait nu 07:30 en telt werkdagen, want Rechtspraak publiceert ma–vr en een kalenderdrempel zou elke maandag vals alarm geven.

    SPOOR-09PR #290
  • Labelselectie repareren

    AfGemeten

    Elke toekomstige meting van relevantie zegt eindelijk iets over de scorer in plaats van over de labelset.

    De labeltool trok paren uniform-random uit data/rulings.json — een bestand dat met tien andere experimenten wordt gedeeld en op 2026-04-25 is overschreven, drie dagen ná het labelen. Wat er nu in staat: 200 uitspraken, waarvan 3 ruimtelijk. Van de 180 paren die de tool serveerde had 96% aan géén van beide kanten een ruimtelijke uitspraak; de eerste vraag voor team Omgevingsplan was of een strafrechtzaak of een socialezekerheidszaak relevanter is. Slechts 1 van de 181 bestaande labels hoorde nog bij een geserveerd paar. Verholpen: eigen pool (81% ruimtelijk) plus gestratificeerde selectie — nu 160/180 paren ruimtelijk aan beide kanten, 0 aan geen van beide.

    SPOOR-11PR #292PR #295Cockpit 616afa20
  • Echte menselijke labels verzamelen

    Gemeten

    Voor het eerst kunnen zeggen hoe goed de scorer is, in plaats van hoe sterk hij op Opus lijkt.

    De 180 'redacteurslabels' waarop elke relevantiemeting rust zijn niet van een mens. Het zijn labels van Opus 4.7 via 18 parallelle subagents — de spec van 22 april zegt het letterlijk, en de daar genoemde verdeling (3 gelijkspelen, 62 laag / 53 gemiddeld / 62 hoog) komt exact overeen met het labelbestand. De menselijke UI kón 'hoog' niet eens produceren: zekerheid stond hardcoded op 'gemiddeld'. Er is precies één echt menselijk relevantielabel, uit juli. De controle die die spec inplande — 20 paren blind labelen, kappa ≥ 0,6 — is nooit uitgevoerd. Elke vergelijking tot nu toe is dus één model dat een ander model beoordeelt, inclusief de bake-off van 11 augustus.

    SPOOR-11PR #296
  • De 0,05-vloer van de scorer herzien

    Gemeten

    Een echte omgevingsrechtelijke uitspraak krijgt niet langer dezelfde score als een snelheidsboete.

    De bake-off concludeerde dat de scorer beide uitspraken in 59% van de paren terecht als irrelevant afdeed. Dat klopt niet, en het bewijs staat los van welk label dan ook: het rechtsgebiedveld komt van rechtspraak.nl. Van de 26 paren die álle drie de modellen op de vloer zetten, zetten er 7 een ruimtelijke uitspraak tegenover een strafrecht- of vreemdelingenzaak. Bij drie daarvan vloerden alle drie de modellen zowel een omgevingsvergunning als een snelheidsboete op 0,05. De modellen zijn het bovendien maar over 26 van de 41 gevloerde paren eens (Jaccard 0,63), dus 'gevloerd' is deels een modelartefact.

    SPOOR-11PR #295
  • Smalle teams anders meten dan brede

    Gemeten

    Evenementen en arbeidsmigratie worden eindelijk ergens op gemeten, in plaats van op paren zonder antwoord.

    Eerder leek dit een scope-probleem: evenementen 0,100, arbeidsmigratie 0,111, wonen 0,267 — op of onder kans. Dat was een meetartefact. Splits je de gelijkspelen eruit, dan had evenementen 9 van de 10 paren gelijk en arbeidsmigratie 8 van de 9; er bleef één informatief paar over per team. Niet slecht dus, maar ongemeten. De oorzaak is rekenkundig: een paar zegt alleen iets als béide uitspraken het team raken, dus bij een onderwerpaandeel p is dat kans p². Evenementen zit op 0,024 en arbeidsmigratie op 0,034, tegen omgevingsplan 0,159. Voor smalle teams is de goede vraag daarom niet 'welke van deze twee' maar 'raakt deze het team überhaupt' — één label per uitspraak in plaats van één per paar.

    SPOOR-11PR #292PR #297Cockpit a9107389

Volgend

Zodra 'Nu' leeg is — de volgorde ligt vast, de invulling niet.
  • Echte ontvangers

    Gemeten

    De nieuwsbrief bereikt iemand anders dan de redactie.

    De subscribers-tabel is leeg. Alle post gaat nu naar de editor-allowlist. Er is dus nog geen enkel signaal over wat lezers waarderen, en zonder dat blijft elke relevantiekeuze een interne aanname. Dit is de brug naar Spoor 10 (naar buiten brengen).

    SPOOR-10
  • Meten wat de dispatch écht doet

    Afgeleid

    We weten hoe vaak de mail iets stuurt dat er niet in hoort, en hoe vaak hij iets mist.

    De dispatch beslist binair (haalt deze uitspraak de vloer voor dit team?), maar alle bestaande grond­waarheid is pairwise — een ránkingvraag. We meten dus niet wat we gebruiken. De droogloop van 11 augustus: 2.940 combinaties bekeken, 2.818 onder de vloer, 86 onder de importance-drempel, 35 verstuurd.

    SPOOR-11Cockpit 98e9a843
  • Onderwerp-tagging weer op niveau

    Gemeten

    Chips op de feed kloppen weer.

    Bekende degradatie: dezelfde scorer haalt bij een verse run ~3x meer recall, dus het is doorvoer/throttling en geen capaciteit. Nu extra vertroebeld doordat de tagger tijdens de storing 0 jobs kreeg — alles viel onder de relevantievloer omdat er geen teamscores waren.

    SPOOR-11
  • Vendor-keuze geparkeerd (bewust)

    Gemeten

    Geen tijd meer verliezen aan modelvergelijkingen.

    Cursor, Sonnet 5 en Haiku 4.5 zijn statistisch niet te onderscheiden op teamrelevantie (McNemar p=0,727 en p=1,000; 620/756 scorecellen byte-identiek; bij hoge zekerheid alle drie exact 0,727). Het model is niet de knop. Operationeel pleit wél iets voor het abonnement: Cursor laadt ~71k inputtokens per call. Als we ooit wisselen is Haiku de goedkoopste die niets inlevert.

    SPOOR-11PR #292

Later

Richting, geen belofte.
  • Volle breedte van Spoor 11

    Aanname

    Niet alleen uitspraken en RvS-adviezen, maar elke bron die verandert en ertoe doet.

    Spoor 11 dient 'actueel blijven'; de cockpit noteert de Nieuwsbrief als het enige huidige gereedschap met 'volle breedte nog te bouwen'. Welke bronnen daarbij horen is nog niet belegd — dat is een keuze, geen bevinding.

    SPOOR-11
  • Pull-kant naar de Scanning Hub

    Aanname

    Zoeken-op-onderwerp gebeurt waar de dossiers wonen; de push blijft hier.

    Eerder besloten: de push (mail, edities) blijft in de Nieuwsbrief, de pull (onderwerp-gestuurd zoeken) hoort bij de Hub. Nog niet uitgevoerd.

    SPOOR-11