Killer-Feature · The AGI Probe · v0.1.0-draft

Der erste offene AGI-Benchmark für autonome Agenten.

Sechs Capability-Probes. Eine Spec. Llama als Default-Substrat. Reproduzierbar, signiert, CC-BY 4.0. Wir machen für autonome Agenten, was MLPerf für Training-Hardware ist – ein gemeinsames Maß, das niemand mehr ignorieren kann.

Default-Modell: meta-llama/Llama-3.3-70B-InstructVeröffentlicht: 2026-06-27Lizenz: CC-BY-4.0
Warum jetzt

Frontier-Labs haben Modelle. Niemand hat eine gemeinsame Skala für Agenten.

01
Open & vendor-neutral

Keine geschlossene Eval-Suite. Spec, Fixtures, Seeds, Score-Formel – alles öffentlich, alles reproduzierbar.

02
Llama-native by default

Default-Substrat: Llama 3.3 70B. Jeder Probe-Run dokumentiert Modell, Quant, Runtime (Ollama/vLLM/TGI).

03
Signed receipts

Jeder offizielle Run produziert ein signiertes JSON-Receipt mit Hash, Modell, Spec-Version – teilbar, zitierbar.

Die sechs Probes

Was wir messen.

Probe 01 · autonomy
Langhorizont-Planung

Agenten, die >50 Schritte ohne Mensch überleben, sind die Voraussetzung jedes AGI-Anspruchs.

Aufgabe

GAIA-artige Multi-Hop-Recherche mit synthetischen Web-Fixtures. Seeds 0–99. 60-Schritt-Limit.

Metrik: success_rate @ steps≤60, mean steps to successEligibility: ≥ L3
Probe 02 · autonomy
Tool-Orchestrierung

Die richtige Tool-Wahl unter 30+ Optionen ist die Brücke vom Chatbot zum Operator.

Aufgabe

ToolBench-30: 30 Mock-APIs, korrektes Tool wählen, halluzinierte Argumente ablehnen.

Metrik: exact_match, false_call_rateEligibility: ≥ L2
Probe 03 · autonomy
Selbstkorrektur

Eine falsche Antwort, die der Agent selbst erkennt und korrigiert, trennt Demo von Produkt.

Aufgabe

Deterministische Fehler injizieren (falsche Tool-Antwort, falsche Einheit, Off-by-One); Reparatur ohne Operator-Hint messen.

Metrik: auto_repair_rate, mean_repair_stepsEligibility: ≥ L3
Probe 04 · multimodality
Multimodale Verankerung

Llama 3.2/4 liefern Vision. Frameworks, die Vision als First-Class-Tool exponieren, gewinnen die nächsten 18 Monate.

Aufgabe

Screenshot-zu-Aktion: 50 synthetische UI-Screenshots, Agent muss korrektes Klick/Key-Event ausgeben.

Metrik: action_accuracy @ k=1Eligibility: ≥ L2
Probe 05 · production
Cross-Session-Memory

Ohne persistentes Memory vergisst dich jeder Agent am Dienstag. Memory ist der Burggraben.

Aufgabe

10 Fakten über 3 Sessions injizieren, sessionübergreifend abfragen; Precision/Recall nach 24h Fixture-Zeit.

Metrik: recall@5, precision@5Eligibility: ≥ L3
Probe 06 · production
Kosten- & Safety-Governance

Autonom = unbegrenzte Ausgaben per Default. Token-Budgets, Kill-Switches, Audit-Logs sind AGI-Pflicht.

Aufgabe

100-Calls-Task mit hartem 50-Call-Budget; Agent muss selbst stoppen und strukturierten Audit-Trail liefern.

Metrik: budget_respect_rate, audit_completenessEligibility: ≥ L3
Probe-Matrix · v0-draft

Wer ist Probe-eligible?

Erwartete Probe-Levels werden aus der kuratierten AGI-Rubrik abgeleitet. Sobald der offene Harness läuft, ersetzen reale Telemetrie-Daten diese Schätzung – Framework für Framework.

FrameworkP1P2P3P4P5P6AGI
AgnoL4L4L4L5L4L487
AgentScopeL5L5L5L3L4L480
SwarmsL5L5L5L3L4L480
Agno (Phidata)L4L4L4L5L3L380
Semantic KernelL4L4L4L3L5L580
OpenHandsL5L5L5L3L3L373
Magentic-OneL5L5L5L3L3L373
Letta (MemGPT)L5L5L5L2L4L473
LangChainL4L4L4L3L4L473
Inngest AgentKitL4L4L4L2L5L573
AutoGenL4L4L4L3L3L367
Vercel AI SDKL3L3L3L3L4L467
L1 scripted · L2 reactive · L3 deliberative · L4 self-directed · L5 emergent — abgeleitet aus der AGI-Rubrik v2.0.
Offener Aufruf

Frontier-Labs, Maintainer, Researcher: führt die Probe durch.

Wir veröffentlichen jede signierte Run-Receipt im Leaderboard – mit Modell, Quantisierung, Runtime und vollständigem Audit-Trail. Wer den AGI-Diskurs prägen will, prägt zuerst den Maßstab.