Skip to content
AI Literacy
Zurück zu den Lernmaterialien

KI-Literacy Assessment Instrument — Spec

23. August 2026~8 Min.

KI-Literacy Assessment Instrument — Spec (Phase 5)

Status: draft v1.1 (aktualisiert 2026-08-23) · Baut auf: Guide 2 §2.1–2.2 (Instrumente, Warnungen) und Guide 1 §2.1 (Construct-Modell) · Zweck: Spezifikation für ein aufgabenbasiertes, berufsaligniertes KI-Literacy-Assessment — die fehlende objektive Messungsebene für Art.-4-Compliance und Programmevaluation. Korpus aktualisiert auf 11.640 Papers (siehe gap_analysis.md für zell-level Priorisierung).


1. Design-Anforderungen (aus der Evidenz)

AnforderungEvidenz-Basis
Aufgabenbasiert, nicht nur SelbstauskunftSR-vs-OB-Divergenz (C): selbstberichtete und objektive Literacy korrelieren schwach — Baseline/Abschluss müssen denselben objektiven Typ nutzen
Berufsalignierte AufgabenTask-Orientierung-Befund (E→D): Wissensdefinitionen verfehlen, was Workers brauchen (Ausgaben interpretieren, Tool-Auswahl, ethisches Urteil); FALCON-AI-Roll-Einbettung + Radiologie-Experiment-Vorlage
Stufenbewusste NiveausKonvergente Frameworks (DALF 3-Stufen, AI Fluency 6-Level, 5-Stufen-Kontinuum, RAIL-Ed) → 4 nutzbare Level
Explizites Construct-ModellA-Factor (ein dominanter Faktor, 44 % Varianz) vs MAIL-CS (4 Faktoren) — Spec muss ihr Modell benennen
Art.-4-ready EvidenzketteCompliance verlangt Rolle × Aufgabe × Maß-Mapping (Guide 2 §4)

2. Construct-Modell

Drei Achsen (Guide 1 §2.1-Synthese):

  • Kompetenz-Tiefe — Wissen → Anwendung → Evaluation → Kreation
  • Autonomie — Abhängigkeit → Unabhängigkeit (mit angemessenem Reliance-Urteil)
  • Disposition — Einstellungen, Selbstwirksamkeit, Mindset (AI Mindset triadisch)

Globales Stage: Jedes Assessment-Ergebnis mappt auf einen 4-Level-Kontinuum, der DALF + AI Fluency + das Avoidance↔Reliance-Spektrum verdichtet:

LevelLabelBeobachtbares Verhalten (Task-Evidenz)
1AwarenessErkennt KI-Fähigkeiten/Grenzen; kann beschreiben, was das Tool tut; braucht Prompt, um es zu nutzen
2ApplicationNutzt ein gegebenes Tool bei einer definierten Aufgabe; prüft Ausgaben auf offensichtliche Fehler; folgt vorgegebenen Guardrails
3EvaluationWählt Tools nach Aufgaben-Passung; interpretiert und kritisiert Ausgaben; handhabt Edge Cases und Fehlermodi; dokumentiert Prozess
4IntegrationGestaltet eigene Workflows mit KI; evaluiert breitere Konsequenzen (Ethik, Risiko, Compliance); lehrt andere; kalibriert Reliance (weder vermeidend noch unkritisch)

3. Instrumenten-Architektur

┌──────────────────────────────────────────────────────────┐
│ KERN: Task-Based Performance Assessment (objektiv,        │
│ berufsaligniert) — bewertet per Rubric, nicht Selbstauskunft│
│  • 4-6 Aufgaben aus der Task-Matrix der Rolle (§4)        │
│  • jede Aufgabe zielt auf 1-2 Level; Rubrics verankern Scores│
│  • Session: 45-60 Min, proktoriert oder plattform-geführt │
├──────────────────────────────────────────────────────────┤
│ BEGLEITEND (optional): Self-Report-Batterie              │
│  • Disposition-Items (Selbstwirksamkeit, Einstellungen, Mindset)│
│  • GenAI-Reliance-Muster (GenAI-RTS-inspiriert)          │
│  • dient der SR-vs-OB-Gap-Berechnung — nie als Score      │
└──────────────────────────────────────────────────────────┘

4. Berufsalignierte Task-Matrizen

Task-Matrizen sind die rollenseitige Schnittstelle. Jede Matrix-Zeile ist Rolle-Aufgabe → (Evidenz, Level, Gewicht). Beispiele:

RolleAufgabe (arbeitsplatzreal)Ziel-LevelErfasste Evidenz
Knowledge Worker (Office)Entwirft eine Kundenantwort mit LLM unter Policy-Guardrail; identifiziert die halluzinierte Behauptung2–3Ausgabenqualität, Guardrail-Einhaltung, Fehlerdetektion
VertriebNutzt CRM-Copilot, um Deal-Risiken aus Call-Transkript zu extrahieren; begründet Tool-Wahl2–3Tool-Auswahl, Urteil, Begründung
Dev / AnalystInterpretiert Modell-Ausgabe für Business-Entscheidung; nennt Annahmen & Fehlermodi3–4Interpretation, Unsicherheits-Handhabung
FührungskraftEntwirft 1-Wochen-KI-Workflow für Team inkl. ethik-/regulierungs-Check3–4Workflow-Design, Konsequenzanalyse
Support / KMUBearbeitet Kundenfall mit KI-Assistenten; eskaliert angemessen1–2Angemessene Reliance, Eskalation
Compliance-nahe RolleErstellt KI-Nutzungsdatensatz nach Art.-4-Erwartungen; identifiziert fehlende Dokumentation3Prozesskonformität, Dokumentation

Jede Matrix wird pro Kundenorganisation aus Job-Analyse erzeugt (Task-Inventur × KI-Relevanz-Rating); die Spec liefert Default-Matrizen für die 6 häufigsten ALaaS-Zielrollen.

5. Task-Vorlagen & Bewertungs-Rubric

Task-Vorlage (eine Seite pro Aufgabe):

  1. Stimulus — realistischer Input (Dokument, Transkript, Datensatz, Prompt)
  2. Prompt — was die Fachkraft produzieren muss (Deliverable + Prozess-Notizen)
  3. Constraints — Guardrails, erlaubte Tools, Zeit
  4. Evidence Points — 3-5 Rubric-Items mit Ankern

Rubric-Anker-Stil (5 Punkte pro Item): 0 — scheitert bei Aufgabe / unsichere Ausgabe; 1 — erledigt mit groben Fehlern oder unentdeckter Halluzination; 2 — korrekt mit kleinen Fehlern; 3 — korrekt + verifiziert Ausgabe + nennt Grenzen; 4 — korrekt + optimiert Prozess + evaluiert Konsequenzen. Level = Rubric-Score gemappt auf die §2-Stufentabelle.

6. Administration & Scoring

  • Modus: proktoriert oder plattform-geführt mit Session-Logging
  • Scoring: Rubric durch geschulten Rater; Inter-Rater-Reliabilitäts-Check (κ ≥ .7) auf 10 %-Stichprobe; oder regelbasiertes Scoring für Plattform-Tasks
  • Reporting: Level pro Achse (Kompetenz / Autonomie / Disposition) + globales Stage + SR-vs-OB-Gap + Task-Level-Stärken
  • Baseline/Abschluss-Protokoll: identisches Instrument an beiden Punkten (die SR-vs-OB-Warnung); Retest-Abstand ≥ 6 Wochen gegen Practice-Effekte

7. Psychometrisches Validierungsprotokoll (durchzuführen)

SchrittMethodeErfolgskriterium
InhaltsvaliditätExpert:innen-Panel zu Task-Matrizen (Rollen-SMEs + KI-Expert:innen)CVI ≥ .80 pro Item
PilotN ≥ 30 pro Rolle; Item-AnalyseItem-total r ≥ .3; keine Decke/Boden > 60 %
Construct-ValiditätEFA/CFA auf Rubric-Scores über RollenModellfit: CFI ≥ .90, RMSEA ≤ .08
Reliabilitätα / ω pro Level+Achse≥ .80
Kriteriums-ValiditätTask-Scores vs. Job-Performance-Ratings / AICOSr ≥ .3
SR-vs-OB-KalibrierungBegleit-Batterie vs. Task-ScoresGap berichten; nicht zu einem Score mergen

8. Art.-4-Evidenzkette (Compliance-Nutzung)

Pro Rolle: Rolle → Task-Matrix → Assessment-Ergebnis → gespeicherte Evidenz. Der Assessment-Output dient zugleich als Art.-4-konforme Dokumentation:

Rolldefinition (Job-Analyse)
  → Task-Matrix (welche KI-Aufgaben die Rolle ausführt)
    → gemessenes Level pro Aufgabe (aufgabenbasiert, objektiv)
      → Evidenz-Datensatz (Session-Log, Rubric-Scores, Datum, Rater)
        → aggregierter Readiness-Report (Level pro Rolle, Gap-Analyse)

SME-Minimum-Variante (99-€-Stufe): 4-Task-Subset + Plattform-Auto-Scoring + dasselbe Evidenz-Datensatz-Format, damit Kunden ohne Baseline-Neuaufbau auf die volle Batterie upgraden können.

9. Versionierung & lebendige Updates

  • Spec versioniert im Repo (v1); Instrument-Items separat versioniert (AILA-T v1.0)
  • Item-Bank-Refresh quartalsweise (neue Tool-Klassen, Prompt-Injection-/Agentic- Szenarien, sobald sie ins Korpus kommen)
  • Validierungsdaten als Tier-(B/C)-Evidenz ins Korpus, sobald N ≥ 150

10. Instrumenten-Referenz — korpus-gestützte Auswahl (2026-08-23)

Die §3-Architektur ist bewusst instrumenten-agnostisch (sie spezifiziert die Messungsebene, nicht einen festen Fragebogen). Aber das aktualisierte Korpus enthält jetzt genug validierte Instrumente, um beide Ebenen konkret zu säen. Nutzen Sie diese Tabelle, um zu lizenzieren/anzupassen statt neu zu bauen.

InstrumentConstruct-Abdeckung (Achsen)Level-BereichPopulation / RollenfitZu säende Ebene
AICOS (objektive Kompetenz, GenAI-Dimension)Kompetenz-Tiefe, Autonomie2–4Erwachsene, allgemeinKERN objektiver Proxy (bevorzugt)
MAIL-CS (32 Items, 4 Faktoren; α=.91, ω=.92)Kompetenz-Tiefe, Disposition2–4StudierendeKERN / Kriteriums-Validitäts-Anker
SFAILQ (sechs Facetten; Adoleszenz→Mitte)Kompetenz-Tiefe, Disposition1–4Multi-Kohort-ErwachseneKERN für Erwachsenen-, altersübergreifend
SAIL4ALL (56 Items, 4 Themen)Kompetenz-Tiefe1–3Erwachsene, jedes SettingKERN-Screening
FALCON-AI (rollen-embedded, CTRL)Autonomie, Berufsalignierung2–3Faculty / ProfessionalKERN Task-Design-Vorlage
EUIA (6 GenAI-in-Assessment-Level)Kompetenz-Tiefe, Autonomie1–4Assessment-KontexteKERN Level-Anker
AILS (KR) / AILS (Arabic)Kompetenz-Tiefe, Disposition1–3Studierende / cross-kulturellBEGLEITEND cross-kulturell
SNAIL (Nicht-Expert:innen, Gains)Kompetenz-Tiefe1–2Kurs-TeilnehmendeBEGLEITEND Pre/Post-Gains
GenAI-RTS (20 Items, 4 Reliance-Typen)Disposition (Reliance)Schreib-KontexteBEGLEITEND Reliance-Muster
G-Factor / A-Factor-Batterie (18 Items, 4 Dim)Construct-Modell (A-Factor 44 %)Erwachsene (N=517)BEGLEITEND Construct-Evidenz

Auswahlregel für ALaaS: KERN = ein objektives Instrument (AICOS oder MAIL-CS/SFAILQ, wo populations-gematched) plus die §4-Task-Matrix; BEGLEITEND = GenAI-RTS-artige Reliance-Batterie zur SR-vs-OB-Gap-Berechnung (§2 Warnung). Nie ein Self-Report-Instrument zum Score werden lassen.

11. Gap-Alignment — warum diese Spec die Phase-2-Prioritäts-Payoff ist

Der Gap-Analyzer (gap_analysis.md) ordnet compliance/evaluation und die anderen */evaluation-Zellen als dünnste, am stärksten wachsende Weißräume des Korpus ein — d. h. das Feld hat Instrumente, aber fast keine Evidenz, dass Programme sie genutzt haben, besonders für Art. 4. Diese Spec ist das Lieferstück, das diese Schleife schließt: Sie verwandelt die §10-Instrumente in eine Evaluationskette (Rolle → Aufgabe → gemessenes Level → gespeicherte Evidenz), die zugleich Programm-Evaluations-Artefakt und Art.-4-Compliance- Datensatz (§8) ist. Die gepinnten rq3.md-Gap-Cell-Shortlists (z. B. Dutch municipalities' AI Act compliance readiness, das AIconomics Maturity Model) sind die ersten Real-World-Ziele für die §7-Validierung.

Nächste Schritte (Phase 6): die 6 Default-Task-Matrizen mit 2-3 kundenalignierten Rollen piloting; Validierungsschritte §7 durchführen (seed mit SFAILQ + AICOS als objektiven Ankern); Ergebnisse in das ALaaS-Reporting/Upsell- Design einfließen lassen.

Bereit, dein Wissen zu testen?

Probiere unsere Übungsprüfungen mit Hunderten von realistischen Fragen aus.

Üben starten →