// Agentic OS · Lernsystem (Epic 04, S4)

Wirkt das Lernsystem?

Wochenweise Kennzahlen aus dem Destillations-Pass (SB-62), den Lernvorschlaegen und der Eval-Suite (SB-91) - ausschliesslich systembezogene Aggregate, keine Einzelpersonen-Auswertung (Governance SB-60).

Export als CSV (SLA-Beilage)
Kein Regressions-Alarm

Keine der ueberwachten Metriken (Korrektur-Rate, Erst-Anlauf-Erfolgsquote, Eval-Score) hat sich 2 Wochen in Folge verschlechtert.

Korrektur-Rate (aktuelle Woche)
-
0 destillierte Sessions
Erst-Anlauf-Erfolgsquote
-
aktuelle Woche
Eval-Score (SB-91)
-
automatisierte Qualitaetssicht
Korrektur-Rate - Lernkurve
insufficient data
Erst-Anlauf-Erfolgsquote
insufficient data
Eval-Score-Trend (SB-91)
insufficient data
Vorschlaege: angenommen (gruen) vs. abgelehnt (rot)
insufficient data
Woche Sessions Korrektur-Rate Erst-Anlauf-Erfolg Angenommen Abgelehnt Zeit bis Freigabe (h) Eval-Score
2026-07-09 – 2026-07-16 0 - - 0 0 - -
2026-07-16 – 2026-07-23 0 - - 0 0 - -
2026-07-23 – 2026-07-30 0 - - 0 0 - -
2026-07-30 – 2026-08-06 0 - - 0 0 - -
2026-08-06 – 2026-08-13 0 - - 0 0 - -
2026-08-13 – 2026-08-20 0 - - 0 0 - -
2026-08-20 – 2026-08-27 0 - - 0 0 - -
2026-08-27 – 2026-09-03 0 - - 0 0 - -

// "-" = insufficient data (kein erfundener Wert). "Zeit bis Freigabe" ist ein grober Proxy (Datei-mtime als Entscheidungszeitpunkt) - siehe docs/sb-64-lernmetriken-dashboard.md Abschnitt 4.

Metrik-Definitionen
correction_rate Anteil der in einer Woche vom Destillations-Pass (SB-62) analysierten Sessions, die die Heuristik 'wiederholte_korrektur' ausgeloest haben (Nutzer musste denselben Fehler wiederholt korrigieren). Quelle: learning/distill/signals_log.py. Nenner = Sessions dieser Woche mit abgeschlossenem MAP-Lauf; 'insufficient data' bei 0 Sessions.
first_attempt_success_rate Anteil der Sessions OHNE Heuristik 'viele_anlaeufe' (kein langer Anlauf-Burst noetig) - Naeherung fuer 'hat beim ersten Versuch funktioniert'. Gleiche Datenquelle/Nenner wie correction_rate.
proposals_accepted Anzahl Lernvorschlaege (Entwuerfe/Lernsystem/*.md) mit status: angenommen, einer Woche zugeordnet ueber die Datei-mtime (Proxy fuer den Entscheidungszeitpunkt, siehe time_to_release_hours_avg).
proposals_rejected Wie proposals_accepted, aber status: abgelehnt.
time_to_release_hours_avg Grober Proxy fuer 'Zeit bis Freigabe': Stunden zwischen Vorschlag-generated_at (Frontmatter-Datum) und Datei-mtime (Entscheidungs-Proxy), gemittelt ueber alle in dieser Woche entschiedenen Vorschlaege. NICHT verlaesslich (siehe docs/sb-64-lernmetriken-dashboard.md, Abschnitt 'Bewusst offen'): das Frontmatter-Feld last_updated wird beim Statuswechsel nicht mitgezogen, und die Datei-mtime kann durch Git-Operationen (Checkout/Rebase) verfaelscht werden. 'insufficient data', wenn keine gueltige (nicht-negative) Differenz vorliegt.
eval_score Durchschnittlicher RunReport.total_score (evals/score_report.py) aller Eval-Suite-Laeufe (SB-91), deren created_at in diese Woche faellt. 'insufficient data' ohne auswertbare Reports in dieser Woche.
regression_alarm Alarmiert ('regressed'), wenn correction_rate/first_attempt_success_rate/eval_score sich in den letzten 2 aufeinanderfolgenden Wochen in die jeweils schlechte Richtung entwickelt haben (Korrektur-Rate STEIGEND, Erst-Anlauf-Erfolgsquote und Eval-Score SINKEND ist schlechter). 'insufficient_data' bei weniger als 3 lueckenlos gueltigen Wochenwerten.