---
title: "T3MP3ST Review 2026: Ersatz für einen Pentest?"
canonical: https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/
language: de
description: "Evidence-first Review von T3MP3ST: bewiesene vs. experimentelle Funktionen, OWASP-APTS-Lücken, sicherer Pilot und warum es keinen Pentest ersetzt."
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

10 min Lesezeit · 15. Juli 2026

[**Weiter**](/de/blog/vibe-coders-new-junior-developers/)

# T3MP3ST Review 2026: Kann es einen Penetrationstest ersetzen?

TL;DR

T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Sicherheitstests, aber kein Ersatz für einen Penetrationstest. Die stärkste öffentliche Evidenz betrifft toolgestützte Reconnaissance, Scope-Kontrollen, nachvollziehbare Belege und reproduzierbare Single-Agent-Benchmarks. Das Repository bezeichnet den koordinierten Acht-Operatoren-Swarm ausdrücklich als nicht gebenchmarkt und unzuverlässig; in Full-Chain-Runs wurden null Exploits ausgeführt. Unser Vergleich öffentlicher Dokumente mit OWASP APTS zeigt gute Ansätze bei Scope und Auditierbarkeit, aber nur teilweise oder nicht belegte Kontrollen für Safety, abgestufte Autonomie, Manipulationsresistenz, Supply Chain und Reporting. Pilotiere zuerst in einem absichtlich verwundbaren Lab, dann in isoliertem Staging, mit schriftlichen Rules of Engagement, gepinntem Commit, Aufsicht und evidence-basierter Abnahme. Für Business Logic, Assurance und finale Verantwortung bleibt ein unabhängiger Pentest nötig.

**Nein, jedenfalls heute nicht.** T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Security-Tests: vor allem für Reconnaissance, wiederholbare Lab-Tests und Evidence Capture. Es ersetzt weder einen unabhängigen Penetrationstest noch menschliche Business-Logic-Reviews oder Compliance-taugliche Assurance. Das Repository sagt selbst, dass die Benchmarks aus einem Single-Agent-Loop stammen und koordinierte Swarm-Exploitation unbewiesen bleibt.

Genau das ist die nützliche Kaufentscheidung. Wir haben das öffentliche Repository am 15. Juli 2026 geprüft und die vorhandenen Belege den acht Governance-Domänen des [OWASP Autonomous Penetration Testing Standard (APTS)](https://owasp.org/APTS/standard/) gegenübergestellt. Das ist ein Dokumenten-Review, kein formales Conformance-Audit und kein Hands-on-Pentest.

## Was ist T3MP3ST?

[T3MP3ST](https://github.com/elder-plinius/T3MP3ST) ist eine TypeScript-basierte Orchestrierungsschicht. Sie verbindet Claude Code, Codex, Hermes oder ein lokales/API-Modell mit Security-Tools, einer Browser-„War Room“, Scope-Kontrollen und einem Evidence Ledger. Es ist ein Harness, kein eigenes Security-Modell.

| Öffentlicher Fakt, Stand 15. Juli 2026 | Bedeutung für Käufer |
| --- | --- |
| AGPL-3.0-or-later, Package-Version 1.0.0 | Open Source; modifizierte Netzwerk-Deployments brauchen Lizenzprüfung. |
| 35 Default-Tools, 83 im Opt-in-Arsenal | Breite Tool-Abdeckung erhöht auch den Governance-Aufwand. |
| War Room, CLI, HTTP API und ein live MCP-Tool | Flexibel integrierbar, aber jede Control Surface muss gehärtet werden. |
| Keine veröffentlichte GitHub-Release | Einen geprüften Commit pinnen; main ist kein stabiler Vendor-Release. |
| Vom Repository gemeldeter XBEN Black-box pass@1-Mittelwert: 90,1 % | Interessant, aber kein Beweis für den Acht-Agenten-Swarm oder deine Anwendung. |

## Was ist bewiesen, was experimentell?

Die [Feature-Dokumentation](https://github.com/elder-plinius/T3MP3ST/blob/main/FEATURES.md) markiert Reconnaissance und Scanning als implementiert. Exploiter, Infiltrator, Exfiltrator, Ghost und Coordinator sind experimentell. Full-chain-Runs hätten null ausgeführte Exploits geliefert; die Headline-Benchmarks stammen vom Single Agent, nicht von der koordinierten Zelle.

| Fähigkeit | Öffentlicher Beleg | Unsere Einordnung |
| --- | --- | --- |
| Reconnaissance und Scanning | Implementierter, tool-backed Loop | Glaubwürdiger Pilot-Scope |
| Finding-Provenienz | Tool-Output, Evidence-Referenzen, Retests | Eine der stärksten Designentscheidungen |
| Single-Agent-Benchmarks | Re-derivable Resultate; gemeldet: 90,1 % XBEN, 23/40 Cybench, 8/10 exakte CVE-Zero-Treffer | Auf gepinntem Commit und eigenem Testset reproduzieren |
| End-to-end Multi-Agent-Exploitation | Explizit unbenchmarked und unzuverlässig | Das Swarm-Versprechen noch nicht kaufen |

Die [Provenienz-Regel](https://github.com/elder-plinius/T3MP3ST/blob/main/docs/VERIFIED_PROVENANCE.md) ist richtig: Modellprosa ist Analyse, kein Beweis. Ein Finding bleibt Hypothese, bis Tool-Output, ein reproduzierbares Artefakt oder ein Retest es stützt.

## Wie schneidet T3MP3ST gegen OWASP APTS ab?

OWASP APTS definiert 173 Pflichtanforderungen in acht Domänen. „Nicht belegt“ bedeutet hier nur, dass die öffentliche Dokumentation nicht reicht, nicht, dass die Kontrolle sicher fehlt.

| APTS-Domäne | Öffentliches Signal | Entscheidung |
| --- | --- | --- |
| Scope Enforcement | Scope Receipts, target-bound Egress-Kontrollen, Out-of-scope-Denial | Vielversprechend; DNS-Rebinding, Zeitfenster und Cloud-Scope testen |
| Safety Controls | Riskante Tools sind approval-gated | Teilweise; Kill Switch, Watchdog, Rollback und Sandbox-Integrität beweisen |
| Human Oversight | Receipts, Approvals und Operator Review | Teilweise; Default-safe Timeouts und irreversible Actions testen |
| Graduated Autonomy | Manuelle und autonome Modi als Konzept | Nicht auf APTS-Level gemappt; Pilot nur supervised |
| Auditability | Evidence Vault, Finding Ledger, Retests, re-derivable Claims | Stärkster Bereich; tamper-evident Logs und isolierten Audit Store prüfen |
| Manipulation Resistance | Scope Enforcement liegt außerhalb des Modells | Für Prompt Injection, feindlichen Target-Output und Runtime-Isolation nicht belegt |
| Supply-chain Trust | Lockfile, Overrides, offener Code | Teilweise; keine Release zum Pinnen, SBOM/Signing/Model-Change-Governance nicht belegt |
| Reporting | Evidence-backed Findings und Markdown-Reports | Teilweise; False Positives, Coverage und unabhängige Reproduktion testen |

## Kann T3MP3ST einen menschlichen Pentest ersetzen?

Nein. Nutze es als Ergänzung für häufigere autorisierte Reconnaissance und Evidence Capture zwischen menschlich geführten Assessments. [NIST SP 800-115](https://csrc.nist.gov/pubs/sp/800/115/final) behandelt Penetrationstests als Teil eines geplanten Assessment-Prozesses mit Rules of Engagement, Analyse und Mitigation. Ein selbst betriebenes Tool erzeugt keine Unabhängigkeit.

| Bedarf | T3MP3ST-Fit heute | Was Menschen leisten müssen |
| --- | --- | --- |
| Wiederholte Recon im isolierten Lab/Staging | Guter Pilot-Kandidat | Scope Owner und Evidence Reviewer |
| Kontinuierliche Security-Signale | Nützliche Ergänzung möglich | Triage, Remediation, Regression Ownership |
| Business Logic und Abuse Cases | Kein bewiesener Ersatz | Produktkontext und adversariales Urteil |
| Kunden-, Investoren- oder Regulatorik-Nachweis | Nur unterstützende Evidenz | Unabhängiger Scope und Report, wo gefordert |

## Wie sieht ein sicherer Pilot aus?

1. **Schriftlicher Mission Contract:** Owner, Targets, erlaubte Aktionen, Zeitfenster, Verbote, Stop-Kriterien und Datenregeln.
2. **Absichtlich verwundbares Lab, dann isoliertes Staging:** Produktion ist nicht das erste Experiment.
3. **Commit und Umgebung pinnen:** Modell, Agent, Tools, Prompts, Konfiguration und Target-Image erfassen.
4. **Supervised laufen und Evidenz bewerten:** Jedes Finding braucht Tool-Output, Reproduktionspfad, Severity-Begründung und Retest.
5. **Unabhängigen Pentest behalten:** T3MP3ST soll vermeidbare Findings vorher reduzieren, nicht seine eigene Arbeit zertifizieren.

## Was kostet „Open Source und keyless“ wirklich?

Budgetiere Coding-Agent-Abo oder API, isolierte Umgebung, externe Tools, Operator Review, Evidence Triage, Remediation und Retest. Bei modifizierten Netzwerk-Deployments gehört außerdem die [AGPL](https://www.gnu.org/licenses/agpl.html) in die Lizenzprüfung. Die Geschäftsfrage lautet nicht „Ist es gratis?“, sondern: „Erzeugt ein beaufsichtigter Run mehr verifizierte, behebbare Risikoreduktion pro Engineering-Woche als unser heutiger Scanner-plus-Review-Workflow?“

Wenn du einen reiferen Open-Source-Agent mit veröffentlichten Releases, CI-Kontrollen, Hosted Pricing und einem vom Anbieter ausgeführten 104-Challenge-Benchmark vergleichst, nutze unseren [30-Tage-Guide für einen Strix AI Pentesting Pilot](/de/blog/strix-ai-pentesting-pilot-guide-2026/). Er fokussiert Kosten, Procurement-Evidence und eine messbare Einführungsentscheidung, statt diesen Ersatz-Review zu wiederholen.

Wenn du nicht entscheidest, welches autonome Red-Team-Harness du kaufst, sondern wie du ein starkes Modell während der Evaluation sicher begrenzt, nutze unsere [Security-Checkliste für KI-Agenten-Eval-Sandboxes](/de/blog/ai-agent-eval-sandbox-security-checklist/). Sie behandelt verschachtelte Isolation, Egress, Credentials, Benchmark-Integrität und Incident Response als eigene Architekturfrage.

## Häufige Fragen

### Ist T3MP3ST ein Penetrationstest-Tool?

Es ist ein Open-Source-Harness für autorisierte, KI-gestützte Offensive Security. Am stärksten belegt sind Reconnaissance, Single-Agent-Benchmarks, Scope-Kontrollen und Finding-Provenienz; der koordinierte End-to-end-Swarm ist explizit unbewiesen.

### Kann T3MP3ST einen Penetrationstest ersetzen?

Nein. Es kann häufigere Reconnaissance und Evidence Capture liefern, ersetzt aber weder unabhängigen Scope noch Business-Logic-Tests, qualifizierten Review oder einen geforderten Assurance-Report.

### Ist T3MP3ST sicher für Produktion?

Nicht als erstes Ziel. Starte im verwundbaren Lab, gehe dann in isoliertes Staging mit schriftlichen Rules of Engagement und menschlicher Freigabe für aktive oder irreversible Aktionen.

### Sind die Benchmarks unabhängig?

Nein. Sie stammen vom Repository. Das Projekt liefert allerdings committed Daten und verify-claims zur Neuberechnung. Reproduzierbare First-party-Evidenz ist besser als eine unbelegte Behauptung, aber keine unabhängige Evaluation.

### Was sollte ein CTO im Pilot messen?

Verifizierte Findings pro Operator-Stunde, False-positive-Rate, Reproduzierbarkeit, Remediation- und Retest-Zeit, Out-of-scope-Denials, Human-review-Zeit und Kosten pro geschlossenem High-risk-Finding.

## Fazit

T3MP3ST ist interessant, weil es Provenienz, Scope und überprüfbare Claims ernster nimmt als die meisten AI-Security-Launches. Das ehrliche Urteil bleibt enger als die Headline: Heute ist es ein glaubwürdiges Research- und Supervised-Testing-Harness, kein Ersatz für ein Pentest-Team.

Automatisiere wiederholbare, autorisierte Reconnaissance und Evidence Capture. Behalte Menschen dort, wo Kontext, Unabhängigkeit und Verantwortung zählen: Business Logic, Scope, Remediation und finale Assurance.

## Das könnte dich auch interessieren..

[**QA für KI-generierten Code** Production-Readiness für Autorisierung, Secrets, Fehlerpfade, Dependencies und Regressionen.](/de/blog/qa-for-ai-generated-code/) [**Prototyp direkt launchen oder zuerst härten?** Wann Tempo reicht und wann Nutzer, Geld oder sensible Daten zuerst Hardening verlangen.](/de/compare/ship-vibe-coded-as-is-vs-harden/)

Agent Engineering

## In diesem Cluster weiterlesen

Coding Agents, MCP, Kontextsysteme, Evaluation und Kontrollen für verlässliche Automatisierung.

[Mit dem Grundlagenartikel starten**Graph Engineering für KI-Agenten: Wann lohnt sich ein Knowledge Graph?**](/de/blog/graph-engineering-ai-agents/)

- [Warum Agenten-Edits semantische Identität brauchen: SEMAPRAX in Rust](/de/blog/semantic-identity-rust-agent-edits/)
- [LangChain Deep Agents im Test: Ist das Agent Harness produktionsreif?](/de/blog/langchain-deep-agents-review/)
- [OpenViking im Test 2026: Ist Dateisystem-Memory produktionsreif?](/de/blog/openviking-agent-memory-review/)
- [LLM-as-a-Verifier erklärt: Architektur, Kosten und Produktionseinsatz](/de/blog/llm-as-a-verifier/)
- [TrueForge im Test: Ist das Open-Source Agent Harness produktionsreif?](/de/blog/trueforge-agent-harness-review/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

10 min Lesezeit · 15. Juli 2026

[**Weiter**](/de/blog/vibe-coders-new-junior-developers/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-15",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-15",
      "url": "https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Sicherheitstests, aber kein Ersatz für einen Penetrationstest. Die stärkste öffentliche Evidenz betrifft toolgestützte Reconnaissance, Scope-Kontrollen, nachvollziehbare Belege und reproduzierbare Single-Agent-Benchmarks. Das Repository bezeichnet den koordinierten Acht-Operatoren-Swarm ausdrücklich als nicht gebenchmarkt und unzuverlässig; in Full-Chain-Runs wurden null Exploits ausgeführt. Unser Vergleich öffentlicher Dokumente mit OWASP APTS zeigt gute Ansätze bei Scope und Auditierbarkeit, aber nur teilweise oder nicht belegte Kontrollen für Safety, abgestufte Autonomie, Manipulationsresistenz, Supply Chain und Reporting. Pilotiere zuerst in einem absichtlich verwundbaren Lab, dann in isoliertem Staging, mit schriftlichen Rules of Engagement, gepinntem Commit, Aufsicht und evidence-basierter Abnahme. Für Business Logic, Assurance und finale Verantwortung bleibt ein unabhängiger Pentest nötig.",
  "articleBody": " Blog-Übersicht/AI und Agents/Agent Engineering T3MP3ST Review 2026: Kann es einen Penetrationstest ersetzen? TL;DR T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Sicherheitstests, aber kein Ersatz für einen Penetrationstest. Die stärkste öffentliche Evidenz betrifft toolgestützte Reconnaissance, Scope-Kontrollen, nachvollziehbare Belege und reproduzierbare Single-Agent-Benchmarks. Das Repository bezeichnet den koordinierten Acht-Operatoren-Swarm ausdrücklich als nicht gebenchmarkt und unzuverlässig; in Full-Chain-Runs wurden null Exploits ausgeführt. Unser Vergleich öffentlicher Dokumente mit OWASP APTS zeigt gute Ansätze bei Scope und Auditierbarkeit, aber nur teilweise oder nicht belegte Kontrollen für Safety, abgestufte Autonomie, Manipulationsresistenz, Supply Chain und Reporting. Pilotiere zuerst in einem absichtlich verwundbaren Lab, dann in isoliertem Staging, mit schriftlichen Rules of Engagement, gepinntem Commit, Aufsicht und evidence-basierter Abnahme. Für Business Logic, Assurance und finale Verantwortung bleibt ein unabhängiger Pentest nötig. Nein, jedenfalls heute nicht. T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Security-Tests: vor allem für Reconnaissance, wiederholbare Lab-Tests und Evidence Capture. Es ersetzt weder einen unabhängigen Penetrationstest noch menschliche Business-Logic-Reviews oder Compliance-taugliche Assurance. Das Repository sagt selbst, dass die Benchmarks aus einem Single-Agent-Loop stammen und koordinierte Swarm-Exploitation unbewiesen bleibt. Genau das ist die nützliche Kaufentscheidung. Wir haben das öffentliche Repository am 15. Juli 2026 geprüft und die vorhandenen Belege den acht Governance-Domänen des OWASP Autonomous Penetration Testing Standard (APTS) gegenübergestellt. Das ist ein Dokumenten-Review, kein formales Conformance-Audit und kein Hands-on-Pentest. Was ist T3MP3ST? T3MP3ST ist eine TypeScript-basierte Orchestrierungsschicht. Sie verbindet Claude Code, Codex, Hermes oder ein lokales/API-Modell mit Security-Tools, einer Browser-„War Room“, Scope-Kontrollen und einem Evidence Ledger. Es ist ein Harness, kein eigenes Security-Modell. Öffentlicher Fakt, Stand 15. Juli 2026Bedeutung für Käufer AGPL-3.0-or-later, Package-Version 1.0.0Open Source; modifizierte Netzwerk-Deployments brauchen Lizenzprüfung. 35 Default-Tools, 83 im Opt-in-ArsenalBreite Tool-Abdeckung erhöht auch den Governance-Aufwand. War Room, CLI, HTTP API und ein live MCP-ToolFlexibel integrierbar, aber jede Control Surface muss gehärtet werden. Keine veröffentlichte GitHub-ReleaseEinen geprüften Commit pinnen; main ist kein stabiler Vendor-Release. Vom Repository gemeldeter XBEN Black-box pass@1-Mittelwert: 90,1 %Interessant, aber kein Beweis für den Acht-Agenten-Swarm oder deine Anwendung. Was ist bewiesen, was experimentell? Die Feature-Dokumentation markiert Reconnaissance und Scanning als implementiert. Exploiter, Infiltrator, Exfiltrator, Ghost und Coordinator sind experimentell. Full-chain-Runs hätten null ausgeführte Exploits geliefert; die Headline-Benchmarks stammen vom Single Agent, nicht von der koordinierten Zelle. FähigkeitÖffentlicher BelegUnsere Einordnung Reconnaissance und ScanningImplementierter, tool-backed LoopGlaubwürdiger Pilot-Scope Finding-ProvenienzTool-Output, Evidence-Referenzen, RetestsEine der stärksten Designentscheidungen Single-Agent-BenchmarksRe-derivable Resultate; gemeldet: 90,1 % XBEN, 23/40 Cybench, 8/10 exakte CVE-Zero-TrefferAuf gepinntem Commit und eigenem Testset reproduzieren End-to-end Multi-Agent-ExploitationExplizit unbenchmarked und unzuverlässigDas Swarm-Versprechen noch nicht kaufen Die Provenienz-Regel ist richtig: Modellprosa ist Analyse, kein Beweis. Ein Finding bleibt Hypothese, bis Tool-Output, ein reproduzierbares Artefakt oder ein Retest es stützt. Wie schneidet T3MP3ST gegen OWASP APTS ab? OWASP APTS definiert 173 Pflichtanforderungen in acht Domänen. „Nicht belegt“ bedeutet hier nur, dass die öffentliche Dokumentation nicht reicht, nicht, dass die Kontrolle sicher fehlt. APTS-DomäneÖffentliches SignalEntscheidung Scope EnforcementScope Receipts, target-bound Egress-Kontrollen, Out-of-scope-DenialVielversprechend; DNS-Rebinding, Zeitfenster und Cloud-Scope testen Safety ControlsRiskante Tools sind approval-gatedTeilweise; Kill Switch, Watchdog, Rollback und Sandbox-Integrität beweisen Human OversightReceipts, Approvals und Operator ReviewTeilweise; Default-safe Timeouts und irreversible Actions testen Graduated AutonomyManuelle und autonome Modi als KonzeptNicht auf APTS-Level gemappt; Pilot nur supervised AuditabilityEvidence Vault, Finding Ledger, Retests, re-derivable ClaimsStärkster Bereich; tamper-evident Logs und isolierten Audit Store prüfen Manipulation ResistanceScope Enforcement liegt außerhalb des ModellsFür Prompt Injection, feindlichen Target-Output und Runtime-Isolation nicht belegt Supply-chain TrustLockfile, Overrides, offener",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-15",
  "datePublished": "2026-07-15",
  "description": "T3MP3ST ist ein vielversprechendes Open-Source-Harness für autorisierte, KI-gestützte Sicherheitstests, aber kein Ersatz für einen Penetrationstest. Die stärkste öffentliche Evidenz betrifft toolgestützte Reconnaissance, Scope-Kontrollen, nachvollziehbare Belege und reproduzierbare Single-Agent-Benchmarks. Das Repository bezeichnet den koordinierten Acht-Operatoren-Swarm ausdrücklich als nicht gebenchmarkt und unzuverlässig; in Full-Chain-Runs wurden null Exploits ausgeführt. Unser Vergleich öffentlicher Dokumente mit OWASP APTS zeigt gute Ansätze bei Scope und Auditierbarkeit, aber nur teilweise oder nicht belegte Kontrollen für Safety, abgestufte Autonomie, Manipulationsresistenz, Supply Chain und Reporting. Pilotiere zuerst in einem absichtlich verwundbaren Lab, dann in isoliertem Staging, mit schriftlichen Rules of Engagement, gepinntem Commit, Aufsicht und evidence-basierter Abnahme. Für Business Logic, Assurance und finale Verantwortung bleibt ein unabhängiger Pentest nötig.",
  "headline": "T3MP3ST Review 2026: Ersetzt es einen Penetrationstest?",
  "image": "https://wavect.io/img/blog/headers/header_t3mp3st-ai-red-teaming-review-2026.svg",
  "inLanguage": "de",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/",
  "wordCount": 1281
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/agent-engineering/",
      "name": "Agent Engineering",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/t3mp3st-ai-red-teaming-review-2026/",
      "name": "T3MP3ST Review 2026: Ersatz für einen Pentest? | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es ist ein Open-Source-Harness für autorisierte, KI-gestützte Offensive Security. Am stärksten belegt sind Reconnaissance, Single-Agent-Benchmarks, Scope-Kontrollen und Finding-Provenienz; der koordinierte End-to-end-Swarm ist explizit unbewiesen."
      },
      "name": "Ist T3MP3ST ein Penetrationstest-Tool?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Es kann häufigere Reconnaissance und Evidence Capture liefern, ersetzt aber weder unabhängigen Scope noch Business-Logic-Tests, qualifizierten Review oder einen geforderten Assurance-Report."
      },
      "name": "Kann T3MP3ST einen Penetrationstest ersetzen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nicht als erstes Ziel. Starte im verwundbaren Lab, gehe dann in isoliertes Staging mit schriftlichen Rules of Engagement und menschlicher Freigabe für aktive oder irreversible Aktionen."
      },
      "name": "Ist T3MP3ST sicher für Produktion?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Sie stammen vom Repository. Das Projekt liefert allerdings committed Daten und verify-claims zur Neuberechnung. Reproduzierbare First-party-Evidenz ist besser als eine unbelegte Behauptung, aber keine unabhängige Evaluation."
      },
      "name": "Sind die Benchmarks unabhängig?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Verifizierte Findings pro Operator-Stunde, False-positive-Rate, Reproduzierbarkeit, Remediation- und Retest-Zeit, Out-of-scope-Denials, Human-review-Zeit und Kosten pro geschlossenem High-risk-Finding."
      },
      "name": "Was sollte ein CTO im Pilot messen?"
    }
  ]
}
```
