KI-Literacy Assessment Instrument — Spec
KI-Literacy Assessment Instrument — Spec (Phase 5)
Status: draft v1.1 (aktualisiert 2026-08-23) · Baut auf: Guide 2 §2.1–2.2
(Instrumente, Warnungen) und Guide 1 §2.1 (Construct-Modell) · Zweck:
Spezifikation für ein aufgabenbasiertes, berufsaligniertes KI-Literacy-Assessment
— die fehlende objektive Messungsebene für Art.-4-Compliance und
Programmevaluation. Korpus aktualisiert auf 11.640 Papers (siehe
gap_analysis.md für zell-level Priorisierung).
1. Design-Anforderungen (aus der Evidenz)
| Anforderung | Evidenz-Basis |
|---|---|
| Aufgabenbasiert, nicht nur Selbstauskunft | SR-vs-OB-Divergenz (C): selbstberichtete und objektive Literacy korrelieren schwach — Baseline/Abschluss müssen denselben objektiven Typ nutzen |
| Berufsalignierte Aufgaben | Task-Orientierung-Befund (E→D): Wissensdefinitionen verfehlen, was Workers brauchen (Ausgaben interpretieren, Tool-Auswahl, ethisches Urteil); FALCON-AI-Roll-Einbettung + Radiologie-Experiment-Vorlage |
| Stufenbewusste Niveaus | Konvergente Frameworks (DALF 3-Stufen, AI Fluency 6-Level, 5-Stufen-Kontinuum, RAIL-Ed) → 4 nutzbare Level |
| Explizites Construct-Modell | A-Factor (ein dominanter Faktor, 44 % Varianz) vs MAIL-CS (4 Faktoren) — Spec muss ihr Modell benennen |
| Art.-4-ready Evidenzkette | Compliance verlangt Rolle × Aufgabe × Maß-Mapping (Guide 2 §4) |
2. Construct-Modell
Drei Achsen (Guide 1 §2.1-Synthese):
- Kompetenz-Tiefe — Wissen → Anwendung → Evaluation → Kreation
- Autonomie — Abhängigkeit → Unabhängigkeit (mit angemessenem Reliance-Urteil)
- Disposition — Einstellungen, Selbstwirksamkeit, Mindset (AI Mindset triadisch)
Globales Stage: Jedes Assessment-Ergebnis mappt auf einen 4-Level-Kontinuum, der DALF + AI Fluency + das Avoidance↔Reliance-Spektrum verdichtet:
| Level | Label | Beobachtbares Verhalten (Task-Evidenz) |
|---|---|---|
| 1 | Awareness | Erkennt KI-Fähigkeiten/Grenzen; kann beschreiben, was das Tool tut; braucht Prompt, um es zu nutzen |
| 2 | Application | Nutzt ein gegebenes Tool bei einer definierten Aufgabe; prüft Ausgaben auf offensichtliche Fehler; folgt vorgegebenen Guardrails |
| 3 | Evaluation | Wählt Tools nach Aufgaben-Passung; interpretiert und kritisiert Ausgaben; handhabt Edge Cases und Fehlermodi; dokumentiert Prozess |
| 4 | Integration | Gestaltet eigene Workflows mit KI; evaluiert breitere Konsequenzen (Ethik, Risiko, Compliance); lehrt andere; kalibriert Reliance (weder vermeidend noch unkritisch) |
3. Instrumenten-Architektur
┌──────────────────────────────────────────────────────────┐
│ KERN: Task-Based Performance Assessment (objektiv, │
│ berufsaligniert) — bewertet per Rubric, nicht Selbstauskunft│
│ • 4-6 Aufgaben aus der Task-Matrix der Rolle (§4) │
│ • jede Aufgabe zielt auf 1-2 Level; Rubrics verankern Scores│
│ • Session: 45-60 Min, proktoriert oder plattform-geführt │
├──────────────────────────────────────────────────────────┤
│ BEGLEITEND (optional): Self-Report-Batterie │
│ • Disposition-Items (Selbstwirksamkeit, Einstellungen, Mindset)│
│ • GenAI-Reliance-Muster (GenAI-RTS-inspiriert) │
│ • dient der SR-vs-OB-Gap-Berechnung — nie als Score │
└──────────────────────────────────────────────────────────┘
4. Berufsalignierte Task-Matrizen
Task-Matrizen sind die rollenseitige Schnittstelle. Jede Matrix-Zeile ist
Rolle-Aufgabe → (Evidenz, Level, Gewicht). Beispiele:
| Rolle | Aufgabe (arbeitsplatzreal) | Ziel-Level | Erfasste Evidenz |
|---|---|---|---|
| Knowledge Worker (Office) | Entwirft eine Kundenantwort mit LLM unter Policy-Guardrail; identifiziert die halluzinierte Behauptung | 2–3 | Ausgabenqualität, Guardrail-Einhaltung, Fehlerdetektion |
| Vertrieb | Nutzt CRM-Copilot, um Deal-Risiken aus Call-Transkript zu extrahieren; begründet Tool-Wahl | 2–3 | Tool-Auswahl, Urteil, Begründung |
| Dev / Analyst | Interpretiert Modell-Ausgabe für Business-Entscheidung; nennt Annahmen & Fehlermodi | 3–4 | Interpretation, Unsicherheits-Handhabung |
| Führungskraft | Entwirft 1-Wochen-KI-Workflow für Team inkl. ethik-/regulierungs-Check | 3–4 | Workflow-Design, Konsequenzanalyse |
| Support / KMU | Bearbeitet Kundenfall mit KI-Assistenten; eskaliert angemessen | 1–2 | Angemessene Reliance, Eskalation |
| Compliance-nahe Rolle | Erstellt KI-Nutzungsdatensatz nach Art.-4-Erwartungen; identifiziert fehlende Dokumentation | 3 | Prozesskonformität, Dokumentation |
Jede Matrix wird pro Kundenorganisation aus Job-Analyse erzeugt (Task-Inventur × KI-Relevanz-Rating); die Spec liefert Default-Matrizen für die 6 häufigsten ALaaS-Zielrollen.
5. Task-Vorlagen & Bewertungs-Rubric
Task-Vorlage (eine Seite pro Aufgabe):
- Stimulus — realistischer Input (Dokument, Transkript, Datensatz, Prompt)
- Prompt — was die Fachkraft produzieren muss (Deliverable + Prozess-Notizen)
- Constraints — Guardrails, erlaubte Tools, Zeit
- Evidence Points — 3-5 Rubric-Items mit Ankern
Rubric-Anker-Stil (5 Punkte pro Item): 0 — scheitert bei Aufgabe / unsichere Ausgabe; 1 — erledigt mit groben Fehlern oder unentdeckter Halluzination; 2 — korrekt mit kleinen Fehlern; 3 — korrekt + verifiziert Ausgabe + nennt Grenzen; 4 — korrekt + optimiert Prozess + evaluiert Konsequenzen. Level = Rubric-Score gemappt auf die §2-Stufentabelle.
6. Administration & Scoring
- Modus: proktoriert oder plattform-geführt mit Session-Logging
- Scoring: Rubric durch geschulten Rater; Inter-Rater-Reliabilitäts-Check (κ ≥ .7) auf 10 %-Stichprobe; oder regelbasiertes Scoring für Plattform-Tasks
- Reporting: Level pro Achse (Kompetenz / Autonomie / Disposition) + globales Stage + SR-vs-OB-Gap + Task-Level-Stärken
- Baseline/Abschluss-Protokoll: identisches Instrument an beiden Punkten (die SR-vs-OB-Warnung); Retest-Abstand ≥ 6 Wochen gegen Practice-Effekte
7. Psychometrisches Validierungsprotokoll (durchzuführen)
| Schritt | Methode | Erfolgskriterium |
|---|---|---|
| Inhaltsvalidität | Expert:innen-Panel zu Task-Matrizen (Rollen-SMEs + KI-Expert:innen) | CVI ≥ .80 pro Item |
| Pilot | N ≥ 30 pro Rolle; Item-Analyse | Item-total r ≥ .3; keine Decke/Boden > 60 % |
| Construct-Validität | EFA/CFA auf Rubric-Scores über Rollen | Modellfit: CFI ≥ .90, RMSEA ≤ .08 |
| Reliabilität | α / ω pro Level+Achse | ≥ .80 |
| Kriteriums-Validität | Task-Scores vs. Job-Performance-Ratings / AICOS | r ≥ .3 |
| SR-vs-OB-Kalibrierung | Begleit-Batterie vs. Task-Scores | Gap berichten; nicht zu einem Score mergen |
8. Art.-4-Evidenzkette (Compliance-Nutzung)
Pro Rolle: Rolle → Task-Matrix → Assessment-Ergebnis → gespeicherte Evidenz. Der Assessment-Output dient zugleich als Art.-4-konforme Dokumentation:
Rolldefinition (Job-Analyse)
→ Task-Matrix (welche KI-Aufgaben die Rolle ausführt)
→ gemessenes Level pro Aufgabe (aufgabenbasiert, objektiv)
→ Evidenz-Datensatz (Session-Log, Rubric-Scores, Datum, Rater)
→ aggregierter Readiness-Report (Level pro Rolle, Gap-Analyse)
SME-Minimum-Variante (99-€-Stufe): 4-Task-Subset + Plattform-Auto-Scoring + dasselbe Evidenz-Datensatz-Format, damit Kunden ohne Baseline-Neuaufbau auf die volle Batterie upgraden können.
9. Versionierung & lebendige Updates
- Spec versioniert im Repo (
v1); Instrument-Items separat versioniert (AILA-T v1.0) - Item-Bank-Refresh quartalsweise (neue Tool-Klassen, Prompt-Injection-/Agentic- Szenarien, sobald sie ins Korpus kommen)
- Validierungsdaten als Tier-(B/C)-Evidenz ins Korpus, sobald N ≥ 150
10. Instrumenten-Referenz — korpus-gestützte Auswahl (2026-08-23)
Die §3-Architektur ist bewusst instrumenten-agnostisch (sie spezifiziert die Messungsebene, nicht einen festen Fragebogen). Aber das aktualisierte Korpus enthält jetzt genug validierte Instrumente, um beide Ebenen konkret zu säen. Nutzen Sie diese Tabelle, um zu lizenzieren/anzupassen statt neu zu bauen.
| Instrument | Construct-Abdeckung (Achsen) | Level-Bereich | Population / Rollenfit | Zu säende Ebene |
|---|---|---|---|---|
| AICOS (objektive Kompetenz, GenAI-Dimension) | Kompetenz-Tiefe, Autonomie | 2–4 | Erwachsene, allgemein | KERN objektiver Proxy (bevorzugt) |
| MAIL-CS (32 Items, 4 Faktoren; α=.91, ω=.92) | Kompetenz-Tiefe, Disposition | 2–4 | Studierende | KERN / Kriteriums-Validitäts-Anker |
| SFAILQ (sechs Facetten; Adoleszenz→Mitte) | Kompetenz-Tiefe, Disposition | 1–4 | Multi-Kohort-Erwachsene | KERN für Erwachsenen-, altersübergreifend |
| SAIL4ALL (56 Items, 4 Themen) | Kompetenz-Tiefe | 1–3 | Erwachsene, jedes Setting | KERN-Screening |
| FALCON-AI (rollen-embedded, CTRL) | Autonomie, Berufsalignierung | 2–3 | Faculty / Professional | KERN Task-Design-Vorlage |
| EUIA (6 GenAI-in-Assessment-Level) | Kompetenz-Tiefe, Autonomie | 1–4 | Assessment-Kontexte | KERN Level-Anker |
| AILS (KR) / AILS (Arabic) | Kompetenz-Tiefe, Disposition | 1–3 | Studierende / cross-kulturell | BEGLEITEND cross-kulturell |
| SNAIL (Nicht-Expert:innen, Gains) | Kompetenz-Tiefe | 1–2 | Kurs-Teilnehmende | BEGLEITEND Pre/Post-Gains |
| GenAI-RTS (20 Items, 4 Reliance-Typen) | Disposition (Reliance) | — | Schreib-Kontexte | BEGLEITEND Reliance-Muster |
| G-Factor / A-Factor-Batterie (18 Items, 4 Dim) | Construct-Modell (A-Factor 44 %) | — | Erwachsene (N=517) | BEGLEITEND Construct-Evidenz |
Auswahlregel für ALaaS: KERN = ein objektives Instrument (AICOS oder MAIL-CS/SFAILQ, wo populations-gematched) plus die §4-Task-Matrix; BEGLEITEND = GenAI-RTS-artige Reliance-Batterie zur SR-vs-OB-Gap-Berechnung (§2 Warnung). Nie ein Self-Report-Instrument zum Score werden lassen.
11. Gap-Alignment — warum diese Spec die Phase-2-Prioritäts-Payoff ist
Der Gap-Analyzer (gap_analysis.md) ordnet compliance/evaluation und die
anderen */evaluation-Zellen als dünnste, am stärksten wachsende Weißräume des
Korpus ein — d. h. das Feld hat Instrumente, aber fast keine Evidenz, dass
Programme sie genutzt haben, besonders für Art. 4. Diese Spec ist das
Lieferstück, das diese Schleife schließt: Sie verwandelt die §10-Instrumente in
eine Evaluationskette (Rolle → Aufgabe → gemessenes Level → gespeicherte
Evidenz), die zugleich Programm-Evaluations-Artefakt und Art.-4-Compliance-
Datensatz (§8) ist. Die gepinnten rq3.md-Gap-Cell-Shortlists (z. B. Dutch
municipalities' AI Act compliance readiness, das AIconomics Maturity Model)
sind die ersten Real-World-Ziele für die §7-Validierung.
Nächste Schritte (Phase 6): die 6 Default-Task-Matrizen mit 2-3 kundenalignierten Rollen piloting; Validierungsschritte §7 durchführen (seed mit SFAILQ + AICOS als objektiven Ankern); Ergebnisse in das ALaaS-Reporting/Upsell- Design einfließen lassen.
Bereit, dein Wissen zu testen?
Probiere unsere Übungsprüfungen mit Hunderten von realistischen Fragen aus.
Üben starten →