Sechs Capability-Probes. Eine Spec. Llama als Default-Substrat. Reproduzierbar, signiert, CC-BY 4.0. Wir machen für autonome Agenten, was MLPerf für Training-Hardware ist – ein gemeinsames Maß, das niemand mehr ignorieren kann.
Keine geschlossene Eval-Suite. Spec, Fixtures, Seeds, Score-Formel – alles öffentlich, alles reproduzierbar.
Default-Substrat: Llama 3.3 70B. Jeder Probe-Run dokumentiert Modell, Quant, Runtime (Ollama/vLLM/TGI).
Jeder offizielle Run produziert ein signiertes JSON-Receipt mit Hash, Modell, Spec-Version – teilbar, zitierbar.
Agenten, die >50 Schritte ohne Mensch überleben, sind die Voraussetzung jedes AGI-Anspruchs.
GAIA-artige Multi-Hop-Recherche mit synthetischen Web-Fixtures. Seeds 0–99. 60-Schritt-Limit.
Die richtige Tool-Wahl unter 30+ Optionen ist die Brücke vom Chatbot zum Operator.
ToolBench-30: 30 Mock-APIs, korrektes Tool wählen, halluzinierte Argumente ablehnen.
Eine falsche Antwort, die der Agent selbst erkennt und korrigiert, trennt Demo von Produkt.
Deterministische Fehler injizieren (falsche Tool-Antwort, falsche Einheit, Off-by-One); Reparatur ohne Operator-Hint messen.
Llama 3.2/4 liefern Vision. Frameworks, die Vision als First-Class-Tool exponieren, gewinnen die nächsten 18 Monate.
Screenshot-zu-Aktion: 50 synthetische UI-Screenshots, Agent muss korrektes Klick/Key-Event ausgeben.
Ohne persistentes Memory vergisst dich jeder Agent am Dienstag. Memory ist der Burggraben.
10 Fakten über 3 Sessions injizieren, sessionübergreifend abfragen; Precision/Recall nach 24h Fixture-Zeit.
Autonom = unbegrenzte Ausgaben per Default. Token-Budgets, Kill-Switches, Audit-Logs sind AGI-Pflicht.
100-Calls-Task mit hartem 50-Call-Budget; Agent muss selbst stoppen und strukturierten Audit-Trail liefern.
Erwartete Probe-Levels werden aus der kuratierten AGI-Rubrik abgeleitet. Sobald der offene Harness läuft, ersetzen reale Telemetrie-Daten diese Schätzung – Framework für Framework.
| Framework | P1 | P2 | P3 | P4 | P5 | P6 | AGI |
|---|---|---|---|---|---|---|---|
| Agno | L4 | L4 | L4 | L5 | L4 | L4 | 87 |
| AgentScope | L5 | L5 | L5 | L3 | L4 | L4 | 80 |
| Swarms | L5 | L5 | L5 | L3 | L4 | L4 | 80 |
| Agno (Phidata) | L4 | L4 | L4 | L5 | L3 | L3 | 80 |
| Semantic Kernel | L4 | L4 | L4 | L3 | L5 | L5 | 80 |
| OpenHands | L5 | L5 | L5 | L3 | L3 | L3 | 73 |
| Magentic-One | L5 | L5 | L5 | L3 | L3 | L3 | 73 |
| Letta (MemGPT) | L5 | L5 | L5 | L2 | L4 | L4 | 73 |
| LangChain | L4 | L4 | L4 | L3 | L4 | L4 | 73 |
| Inngest AgentKit | L4 | L4 | L4 | L2 | L5 | L5 | 73 |
| AutoGen | L4 | L4 | L4 | L3 | L3 | L3 | 67 |
| Vercel AI SDK | L3 | L3 | L3 | L3 | L4 | L4 | 67 |
Wir veröffentlichen jede signierte Run-Receipt im Leaderboard – mit Modell, Quantisierung, Runtime und vollständigem Audit-Trail. Wer den AGI-Diskurs prägen will, prägt zuerst den Maßstab.