# Deutsche LLM-Security-Toolbox

Eine kuratierte Sammlung von 50+ frei nutzbaren Open-Source-Werkzeugen zur **Absicherung von LLM-Anwendungen**. Diese Liste richtet sich an Entwickler, die ihre eigenen KI-Systeme härten, testen und überwachen möchten.

**Wichtig:** Alle hier aufgeführten Tools dienen der defensiven Sicherheit — dem Testen, Härten und Überwachen der **eigenen** Anwendungen. Diese Liste enthält keine Angriffswerkzeuge oder Anleitungen zum Kompromittieren fremder Systeme.

Kuratiert von der **FlowKI-Community**. Stand der URLs und Lizenzen sollte vor Produktiveinsatz selbst geprüft werden, da sich Open-Source-Projekte weiterentwickeln.

---

## 1. Scanner & Red-Team-Frameworks

Werkzeuge zum systematischen Testen von LLM-Anwendungen auf Schwachstellen — ähnlich wie Penetrationstests bei klassischen Web-Apps.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **garak** | LLM-Vulnerability-Scanner der neuesten Generation von Leon Derczynski. Testet auf Prompt-Injection, Jailbreaks, Halluzinationen, toxische Outputs und mehr. | Apache-2.0 | https://github.com/leondz/garak |
| **PyRIT** | Python Risk Identification Toolkit von Microsoft Azure. Framework für Red-Teaming von generativen KI-Systemen mit automatisierten Adversarial-Prompts. | MIT | https://github.com/Azure/PyRIT |
| **promptfoo** | Testing-Framework für LLM-Outputs mit Assertion-Library, Regression-Testing und automatischen Red-Team-Scans. Unterstützt OpenAI, Anthropic, Llama und mehr. | MIT | https://github.com/promptfoo/promptfoo |
| **Giskard** | End-to-End-Testing für ML-Modelle und LLMs. Automatische Erkennung von Performance-Problemen, Bias, ethischen Risiken und Robustheitslücken. | Apache-2.0 | https://github.com/Giskard-AI/giskard |
| **deepeval** | Evaluation-Framework für LLMs mit Metriken wie Hallucination-Score, Answer-Relevance, Faithfulness und Toxicity. Integriert sich in pytest. | Apache-2.0 | https://github.com/confident-ai/deepeval |
| **OpenAI Evals** | Offizielles Evaluation-Framework von OpenAI. Registry von Test-Datasets und Metriken zur Bewertung von LLM-Fähigkeiten und Sicherheit. | MIT | https://github.com/openai/evals |

---

## 2. Guardrails & Laufzeit-Filter

Frameworks die während der Laufzeit Input und Output von LLMs validieren, filtern und absichern.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **LLM Guard** (Protectai) | Production-ready Guardrails-Toolkit mit 25+ Scannern für Input/Output-Validierung. Erkennt PII, Toxicity, Code-Injection, Prompt-Leaks uvm. | MIT | https://github.com/protectai/llm-guard |
| **Rebuff** (Protectai) | Self-hardening Prompt-Injection-Detector. Nutzt LLMs zur Erkennung von Injections, Heuristics und Vektor-Datenbank für bekannte Muster. | Apache-2.0 | https://github.com/protectai/rebuff |
| **NeMo Guardrails** (NVIDIA) | Toolkit zum Hinzufügen programmierbarer Leitplanken für LLM-Anwendungen. Colang-DSL für sicherheitskritische Dialoglenkung. | Apache-2.0 | https://github.com/NVIDIA/NeMo-Guardrails |
| **Guardrails AI** | Validerung und Strukturierung von LLM-Outputs über RAIL-Spec (Reliable AI Markup Language). Prüft Schema-Konformität, PII-Leaks, Bias. | Apache-2.0 | https://github.com/guardrails-ai/guardrails |
| **LLM Guard** (Laiyer AI) | Weitere Guardrails-Implementierung mit Fokus auf Enterprise-Anforderungen. Modular aufgebaut, integriert sich in Langchain und Llama Index. | MIT | https://github.com/laiyer-ai/llm-guard |
| **Guidance** (Microsoft) | Framework zur Steuerung von LLM-Generierung mit Constraints. Verhindert unerwünschte Outputs durch strukturierte Generation statt nachträglichem Filtern. | MIT | https://github.com/microsoft/guidance |
| **Outlines** | Strukturierte Text-Generierung mit formalen Grammatiken (JSON-Schema, Regex). Garantiert valide Outputs ohne Post-Processing. | Apache-2.0 | https://github.com/outlines-dev/outlines |
| **Instructor** | Strukturierte Output-Extraktion aus LLMs mit Pydantic-Modellen. Type-Safe und validiert Outputs automatisch gegen Schemas. | MIT | https://github.com/jxnl/instructor |

---

## 3. Prompt-Injection- & Jailbreak-Detektion

Spezialisierte Werkzeuge zur Erkennung von Prompt-Injections, Jailbreaks und adversarialen Eingaben.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **Rebuff** | (siehe oben unter Guardrails — primärer Use-Case ist Prompt-Injection-Detection) | Apache-2.0 | https://github.com/protectai/rebuff |
| **LLM Guard PII-Scanner** | Teil des LLM-Guard-Toolkits, speziell für Erkennung von persönlichen Daten in User-Prompts vor Weiterleitung an LLM. | MIT | https://github.com/protectai/llm-guard |
| **Lakera Gandalf** | Interaktive Übungsumgebung für Prompt-Injection-Techniken. Spielerisch lernen, welche Angriffe funktionieren (und wie man sie abwehrt). | — | https://lakera.ai/gandalf |

Weitere Ressourcen zu Prompt-Injection und Jailbreaks finden sich im [KI-Security-Standards-Überblick](https://flowki-club.de/freebies/ki-security-standards).

---

## 4. Evaluation & Testing

Frameworks zur systematischen Bewertung von LLM-Qualität, Korrektheit und Robustheit — unverzichtbar für sichere Produktivsysteme.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **RAGAS** | RAG-Assessment-Framework für Retrieval-Augmented-Generation-Systeme. Misst Context-Relevance, Faithfulness, Answer-Relevance ohne Ground-Truth. | Apache-2.0 | https://github.com/explodinggradients/ragas |
| **TruLens** | Evaluation und Tracking für LLM-Apps. Instrumentation für Langchain/LlamaIndex mit Feedback-Functions für Hallucination, Groundedness, Relevance. | MIT | https://github.com/truera/trulens |
| **deepeval** | (siehe oben unter Scanner — auch starkes Evaluation-Framework) | Apache-2.0 | https://github.com/confident-ai/deepeval |
| **Giskard** | (siehe oben unter Scanner — auch umfangreiche Evaluation-Metriken) | Apache-2.0 | https://github.com/Giskard-AI/giskard |
| **EleutherAI LM Evaluation Harness** | Standard-Benchmark-Suite für Language-Models. Misst Performance auf akademischen Tasks (MMLU, TruthfulQA, etc.). | MIT | https://github.com/EleutherAI/lm-evaluation-harness |
| **Hugging Face Evaluate** | Unified Evaluation-Library mit 100+ Metriken für NLP, Vision, Audio. Integriert in Hugging Face Transformers-Ökosystem. | Apache-2.0 | https://github.com/huggingface/evaluate |
| **UpTrain** | Open-Source Tool für LLM-Evaluation und Observability. Checkt Response-Qualität, Hallucinations, Bias, Language-Quality in Prod. | Apache-2.0 | https://github.com/uptrain-ai/uptrain |

---

## 5. Monitoring & Observability

Tools zur Überwachung von LLM-Anwendungen im Produktivbetrieb — erkennen Anomalien, Performance-Probleme und Sicherheitsvorfälle.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **Langfuse** | Open-Source LLM-Engineering-Platform. Tracing, Prompt-Management, Evaluations, User-Feedback und Analytics für Produktiv-LLMs. | MIT | https://github.com/langfuse/langfuse |
| **Helicone** | Open-Source Observability-Platform für LLM-APIs (OpenAI, Anthropic, etc.). Request-Logging, Caching, Rate-Limiting, Cost-Tracking. | Apache-2.0 | https://github.com/Helicone/helicone |
| **Arize Phoenix** | ML-Observability-Tool mit starkem LLM-Fokus. Tracing für LangChain/LlamaIndex, Embedding-Visualisierung, Drift-Detection. | Apache-2.0 | https://github.com/Arize-ai/phoenix |
| **LangSmith** (Langchain) | Offizielle Langchain-Observability-Plattform. Debugging, Testing, Evaluations und Monitoring für Langchain-Anwendungen. | MIT | https://github.com/langchain-ai/langsmith-sdk |
| **WhyLabs** | Data-Logging-Framework mit LLM-Support. Erkennt Prompt-Injection-Versuche, Toxic-Outputs, PII-Leaks in Produktions-Traffic. | Apache-2.0 | https://github.com/whylabs/whylogs |
| **MLflow** | Klassisches ML-Lifecycle-Management mit LLM-Tracking. Experiment-Tracking, Model-Registry, Deployment — nun auch für LLMs. | Apache-2.0 | https://github.com/mlflow/mlflow |
| **Weights & Biases** | Experiment-Tracking und Visualisierung für ML/AI. LLM-Prompts, Outputs und Evaluations loggen und vergleichen. | Apache-2.0 | https://github.com/wandb/wandb |

---

## 6. Übungs-Umgebungen & Training

Sichere Sandboxes zum Lernen von LLM-Security ohne Produktivrisiko.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **Lakera Gandalf** | (siehe oben unter Prompt-Injection-Detection) Interaktives Prompt-Injection-Training mit 7 Level-Schwierigkeiten. | — | https://lakera.ai/gandalf |
| **Protectai AI-Exploits** | Sammlung von dokumentierten AI/ML-Security-Vorfällen und Exploit-Beispielen zur Schulung und Awareness. | Apache-2.0 | https://github.com/protectai/ai-exploits |

Weitere praktische Anleitungen zum sicheren Aufbau von LLM-Systemen finden sich im [KI-Security-Kit](https://flowki-club.de/freebies/ki-security-kit).

---

## 7. Standards & Referenzen

Offizielle Sicherheitsstandards, Frameworks und Richtlinien für LLM-Anwendungen.

| Ressource | Beschreibung | Herausgeber | URL |
|-----------|--------------|-------------|-----|
| **OWASP Top 10 für LLMs** | Die zehn kritischsten Sicherheitsrisiken bei Large Language Model-Anwendungen. Referenz-Standard der Branche, analog zu OWASP Top 10 für Web-Apps. | OWASP Foundation | https://owasp.org/www-project-top-10-for-large-language-model-applications/ |
| **MITRE ATLAS** | Adversarial Threat Landscape for AI Systems. Framework für ML-spezifische Angriffstechniken, Taktiken und Mitigations nach dem ATT&CK-Modell. | MITRE Corporation | https://atlas.mitre.org/ |
| **NIST AI Risk Management Framework** | Umfassendes Rahmenwerk für verantwortungsvollen AI-Einsatz. Governance, Risikobewertung, Trustworthiness-Prinzipien. | NIST (US) | https://www.nist.gov/itl/ai-risk-management-framework |

Detaillierte Zusammenfassungen dieser Standards bietet der [KI-Security-Standards-Überblick](https://flowki-club.de/freebies/ki-security-standards).

---

## Bonus: Infrastruktur & Tooling

Unterstützende Werkzeuge für sichere LLM-Entwicklung und -Betrieb.

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **LiteLLM** | Unified API für 100+ LLM-Provider (OpenAI, Anthropic, Gemini, etc.). Erleichtert Fallback-Strategien und Vendor-Lock-In-Vermeidung. | MIT | https://github.com/BerriAI/litellm |
| **vLLM** | Hochperformante Inference-Engine für LLMs. PagedAttention-Algorithmus für effizienten Self-Hosting mit begrenzten Ressourcen. | Apache-2.0 | https://github.com/vllm-project/vllm |
| **Ollama** | Lokales LLM-Deployment leicht gemacht. Lädt und betreibt Llama, Mistral, Gemma etc. auf eigener Hardware — kein Cloud-Vendor nötig. | MIT | https://github.com/ollama/ollama |
| **Llama.cpp** | Effiziente C++-Implementierung für Llama-Modelle. Ermöglicht Inference auf Consumer-Hardware (sogar CPU) mit quantisierten Modellen. | MIT | https://github.com/ggerganov/llama.cpp |
| **FastChat** | Plattform zum Training, Serving und Evaluation von Chatbots basierend auf LLMs. Entwickelt vom Team hinter Vicuna und Chatbot Arena. | Apache-2.0 | https://github.com/lm-sys/FastChat |
| **Haystack** (Deepset) | End-to-End-Framework für Search- und QA-Systeme mit LLMs. RAG-Pipelines, Agent-Orchestrierung, Production-Ready. | Apache-2.0 | https://github.com/deepset-ai/haystack |
| **Semantic Kernel** (Microsoft) | SDK für Integration von LLMs in Apps (C#, Python, Java). Planner, Memory, Plugin-System — Fokus auf Enterprise-Anwendungen. | MIT | https://github.com/microsoft/semantic-kernel |
| **LangChain** | Meistgenutztes Framework für LLM-Anwendungen. Chains, Agents, Memory, VectorStores — starkes Ökosystem, aber Sicherheit muss selbst implementiert werden. | MIT | https://github.com/hwchase17/langchain |
| **LlamaIndex** | Daten-Framework für LLM-Anwendungen. Spezialisiert auf Indexing, Retrieval und RAG-Pipelines mit strukturierten/unstrukturierten Daten. | MIT | https://github.com/run-llama/llama_index |

### Vektor-Datenbanken für sichere RAG-Systeme

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **Qdrant** | Vektor-Datenbank in Rust mit Fokus auf Performance und Filtering. RBAC, Encryption-at-Rest, für Produktiv-RAG-Systeme geeignet. | Apache-2.0 | https://github.com/qdrant/qdrant |
| **Weaviate** | GraphQL-basierte Vektor-DB mit Hybrid-Search (Vektor + Keyword). Module für OpenAI, Cohere, Hugging Face-Embeddings. | BSD-3-Clause | https://github.com/weaviate/weaviate |
| **Chroma** | Embedding-Datenbank für AI-Anwendungen. Einfachste Integration, gut für Prototyping — für Produktion ggf. Qdrant/Weaviate erwägen. | Apache-2.0 | https://github.com/chroma-core/chroma |
| **Milvus** | Hochskalierbare Vektor-DB für Milliarden Embeddings. CUDA-Support, Cloud-Native, für Enterprise-RAG-Deployments. | Apache-2.0 | https://github.com/milvus-io/milvus |
| **pgvector** | PostgreSQL-Extension für Vektor-Ähnlichkeitssuche. Nutzt bestehende Postgres-Infrastruktur — kein Extra-System nötig. | PostgreSQL | https://github.com/pgvector/pgvector |
| **pgvecto.rs** | Postgres-Extension in Rust geschrieben. Schneller als pgvector, besonders bei großen Datenmengen. | Apache-2.0 | https://github.com/tensorchord/pgvecto.rs |

### Data & ML-Ops

| Werkzeug | Beschreibung | Lizenz | URL |
|----------|--------------|--------|-----|
| **Label Studio** | Open-Source Data-Labeling-Platform. Annotierung von Trainings- und Evaluationsdaten für LLM-Finetuning und RLHF. | Apache-2.0 | https://github.com/HumanSignal/label-studio |
| **Argilla** | Collaboration-Tool für Daten-Annotation und Model-Feedback. Speziell für LLM-Workflows (Prompt-Curation, Output-Review). | Apache-2.0 | https://github.com/argilla-io/argilla |
| **Prefect** | Workflow-Orchestrierung für Data Pipelines. Scheduling, Monitoring, Error-Handling für LLM-Batch-Jobs und Retraining. | Apache-2.0 | https://github.com/PrefectHQ/prefect |
| **Dagster** | Data-Orchestrator mit Asset-basiertem Ansatz. Software-defined Assets, Type-Checking, für komplexe LLM-Datenpipelines. | Apache-2.0 | https://github.com/dagster-io/dagster |
| **Metaflow** (Netflix) | ML-Infrastructure-Framework von Netflix. Versionierung, Experiment-Tracking, einfaches Deployment von ML/LLM-Workflows. | Apache-2.0 | https://github.com/Netflix/metaflow |
| **ZenML** | MLOps-Framework für reproduzierbare Pipelines. Integrations für alle gängigen ML-Tools, LLM-Stack-Unterstützung. | Apache-2.0 | https://github.com/zenml-io/zenml |

---

## Mitmachen

Diese Liste wird von der **FlowKI-Community** gepflegt. Ergänzungen, Korrekturen oder neue Tool-Kategorien gerne im Discord melden oder als Pull-Request einreichen.

**Wichtiger Hinweis:** Vor dem Produktiveinsatz sollten Lizenzbedingungen, aktuelle Wartungsstatus und Security-Advisories der jeweiligen Projekte selbst geprüft werden. Open-Source-Projekte entwickeln sich schnell weiter.

---

**Kuratiert von der FlowKI-Community** | Stand: August 2026
