// kuratierte toolbox / defensive KI-Security
Deutsche LLM-Security-Toolbox (50+)
Die englische Community hat großartige LLM-Security-Sammlungen — auf Deutsch fehlte eine praxisnahe, gepflegte Übersicht. Diese Toolbox schließt die Lücke: über 50 frei nutzbare Werkzeuge nach Kategorie, mit Lizenz und deutscher Einordnung. Alle Links geprüft.
Eine kuratierte Sammlung von 50+ frei nutzbaren Open-Source-Werkzeugen zur Absicherung von LLM-Anwendungen. Diese Liste richtet sich an Entwickler, die ihre eigenen KI-Systeme härten, testen und überwachen möchten.
Wichtig: Alle hier aufgeführten Tools dienen der defensiven Sicherheit — dem Testen, Härten und Überwachen der eigenen Anwendungen. Diese Liste enthält keine Angriffswerkzeuge oder Anleitungen zum Kompromittieren fremder Systeme.
Kuratiert von der FlowKI-Community. Stand der URLs und Lizenzen sollte vor Produktiveinsatz selbst geprüft werden, da sich Open-Source-Projekte weiterentwickeln.
1. Scanner & Red-Team-Frameworks
Werkzeuge zum systematischen Testen von LLM-Anwendungen auf Schwachstellen — ähnlich wie Penetrationstests bei klassischen Web-Apps.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| garak | LLM-Vulnerability-Scanner der neuesten Generation von Leon Derczynski. Testet auf Prompt-Injection, Jailbreaks, Halluzinationen, toxische Outputs und mehr. | Apache-2.0 | https://github.com/leondz/garak |
| PyRIT | Python Risk Identification Toolkit von Microsoft Azure. Framework für Red-Teaming von generativen KI-Systemen mit automatisierten Adversarial-Prompts. | MIT | https://github.com/Azure/PyRIT |
| promptfoo | Testing-Framework für LLM-Outputs mit Assertion-Library, Regression-Testing und automatischen Red-Team-Scans. Unterstützt OpenAI, Anthropic, Llama und mehr. | MIT | https://github.com/promptfoo/promptfoo |
| Giskard | End-to-End-Testing für ML-Modelle und LLMs. Automatische Erkennung von Performance-Problemen, Bias, ethischen Risiken und Robustheitslücken. | Apache-2.0 | https://github.com/Giskard-AI/giskard |
| deepeval | Evaluation-Framework für LLMs mit Metriken wie Hallucination-Score, Answer-Relevance, Faithfulness und Toxicity. Integriert sich in pytest. | Apache-2.0 | https://github.com/confident-ai/deepeval |
| OpenAI Evals | Offizielles Evaluation-Framework von OpenAI. Registry von Test-Datasets und Metriken zur Bewertung von LLM-Fähigkeiten und Sicherheit. | MIT | https://github.com/openai/evals |
2. Guardrails & Laufzeit-Filter
Frameworks die während der Laufzeit Input und Output von LLMs validieren, filtern und absichern.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| LLM Guard (Protectai) | Production-ready Guardrails-Toolkit mit 25+ Scannern für Input/Output-Validierung. Erkennt PII, Toxicity, Code-Injection, Prompt-Leaks uvm. | MIT | https://github.com/protectai/llm-guard |
| Rebuff (Protectai) | Self-hardening Prompt-Injection-Detector. Nutzt LLMs zur Erkennung von Injections, Heuristics und Vektor-Datenbank für bekannte Muster. | Apache-2.0 | https://github.com/protectai/rebuff |
| NeMo Guardrails (NVIDIA) | Toolkit zum Hinzufügen programmierbarer Leitplanken für LLM-Anwendungen. Colang-DSL für sicherheitskritische Dialoglenkung. | Apache-2.0 | https://github.com/NVIDIA/NeMo-Guardrails |
| Guardrails AI | Validerung und Strukturierung von LLM-Outputs über RAIL-Spec (Reliable AI Markup Language). Prüft Schema-Konformität, PII-Leaks, Bias. | Apache-2.0 | https://github.com/guardrails-ai/guardrails |
| LLM Guard (Laiyer AI) | Weitere Guardrails-Implementierung mit Fokus auf Enterprise-Anforderungen. Modular aufgebaut, integriert sich in Langchain und Llama Index. | MIT | https://github.com/laiyer-ai/llm-guard |
| Guidance (Microsoft) | Framework zur Steuerung von LLM-Generierung mit Constraints. Verhindert unerwünschte Outputs durch strukturierte Generation statt nachträglichem Filtern. | MIT | https://github.com/microsoft/guidance |
| Outlines | Strukturierte Text-Generierung mit formalen Grammatiken (JSON-Schema, Regex). Garantiert valide Outputs ohne Post-Processing. | Apache-2.0 | https://github.com/outlines-dev/outlines |
| Instructor | Strukturierte Output-Extraktion aus LLMs mit Pydantic-Modellen. Type-Safe und validiert Outputs automatisch gegen Schemas. | MIT | https://github.com/jxnl/instructor |
3. Prompt-Injection- & Jailbreak-Detektion
Spezialisierte Werkzeuge zur Erkennung von Prompt-Injections, Jailbreaks und adversarialen Eingaben.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| Rebuff | (siehe oben unter Guardrails — primärer Use-Case ist Prompt-Injection-Detection) | Apache-2.0 | https://github.com/protectai/rebuff |
| LLM Guard PII-Scanner | Teil des LLM-Guard-Toolkits, speziell für Erkennung von persönlichen Daten in User-Prompts vor Weiterleitung an LLM. | MIT | https://github.com/protectai/llm-guard |
| Lakera Gandalf | Interaktive Übungsumgebung für Prompt-Injection-Techniken. Spielerisch lernen, welche Angriffe funktionieren (und wie man sie abwehrt). | — | https://lakera.ai/gandalf |
Weitere Ressourcen zu Prompt-Injection und Jailbreaks finden sich im KI-Security-Standards-Überblick.
4. Evaluation & Testing
Frameworks zur systematischen Bewertung von LLM-Qualität, Korrektheit und Robustheit — unverzichtbar für sichere Produktivsysteme.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| RAGAS | RAG-Assessment-Framework für Retrieval-Augmented-Generation-Systeme. Misst Context-Relevance, Faithfulness, Answer-Relevance ohne Ground-Truth. | Apache-2.0 | https://github.com/explodinggradients/ragas |
| TruLens | Evaluation und Tracking für LLM-Apps. Instrumentation für Langchain/LlamaIndex mit Feedback-Functions für Hallucination, Groundedness, Relevance. | MIT | https://github.com/truera/trulens |
| deepeval | (siehe oben unter Scanner — auch starkes Evaluation-Framework) | Apache-2.0 | https://github.com/confident-ai/deepeval |
| Giskard | (siehe oben unter Scanner — auch umfangreiche Evaluation-Metriken) | Apache-2.0 | https://github.com/Giskard-AI/giskard |
| EleutherAI LM Evaluation Harness | Standard-Benchmark-Suite für Language-Models. Misst Performance auf akademischen Tasks (MMLU, TruthfulQA, etc.). | MIT | https://github.com/EleutherAI/lm-evaluation-harness |
| Hugging Face Evaluate | Unified Evaluation-Library mit 100+ Metriken für NLP, Vision, Audio. Integriert in Hugging Face Transformers-Ökosystem. | Apache-2.0 | https://github.com/huggingface/evaluate |
| UpTrain | Open-Source Tool für LLM-Evaluation und Observability. Checkt Response-Qualität, Hallucinations, Bias, Language-Quality in Prod. | Apache-2.0 | https://github.com/uptrain-ai/uptrain |
5. Monitoring & Observability
Tools zur Überwachung von LLM-Anwendungen im Produktivbetrieb — erkennen Anomalien, Performance-Probleme und Sicherheitsvorfälle.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| Langfuse | Open-Source LLM-Engineering-Platform. Tracing, Prompt-Management, Evaluations, User-Feedback und Analytics für Produktiv-LLMs. | MIT | https://github.com/langfuse/langfuse |
| Helicone | Open-Source Observability-Platform für LLM-APIs (OpenAI, Anthropic, etc.). Request-Logging, Caching, Rate-Limiting, Cost-Tracking. | Apache-2.0 | https://github.com/Helicone/helicone |
| Arize Phoenix | ML-Observability-Tool mit starkem LLM-Fokus. Tracing für LangChain/LlamaIndex, Embedding-Visualisierung, Drift-Detection. | Apache-2.0 | https://github.com/Arize-ai/phoenix |
| LangSmith (Langchain) | Offizielle Langchain-Observability-Plattform. Debugging, Testing, Evaluations und Monitoring für Langchain-Anwendungen. | MIT | https://github.com/langchain-ai/langsmith-sdk |
| WhyLabs | Data-Logging-Framework mit LLM-Support. Erkennt Prompt-Injection-Versuche, Toxic-Outputs, PII-Leaks in Produktions-Traffic. | Apache-2.0 | https://github.com/whylabs/whylogs |
| MLflow | Klassisches ML-Lifecycle-Management mit LLM-Tracking. Experiment-Tracking, Model-Registry, Deployment — nun auch für LLMs. | Apache-2.0 | https://github.com/mlflow/mlflow |
| Weights & Biases | Experiment-Tracking und Visualisierung für ML/AI. LLM-Prompts, Outputs und Evaluations loggen und vergleichen. | Apache-2.0 | https://github.com/wandb/wandb |
6. Übungs-Umgebungen & Training
Sichere Sandboxes zum Lernen von LLM-Security ohne Produktivrisiko.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| Lakera Gandalf | (siehe oben unter Prompt-Injection-Detection) Interaktives Prompt-Injection-Training mit 7 Level-Schwierigkeiten. | — | https://lakera.ai/gandalf |
| Protectai AI-Exploits | Sammlung von dokumentierten AI/ML-Security-Vorfällen und Exploit-Beispielen zur Schulung und Awareness. | Apache-2.0 | https://github.com/protectai/ai-exploits |
Weitere praktische Anleitungen zum sicheren Aufbau von LLM-Systemen finden sich im KI-Security-Kit.
7. Standards & Referenzen
Offizielle Sicherheitsstandards, Frameworks und Richtlinien für LLM-Anwendungen.
| Ressource | Beschreibung | Herausgeber | URL |
|---|---|---|---|
| OWASP Top 10 für LLMs | Die zehn kritischsten Sicherheitsrisiken bei Large Language Model-Anwendungen. Referenz-Standard der Branche, analog zu OWASP Top 10 für Web-Apps. | OWASP Foundation | https://owasp.org/www-project-top-10-for-large-language-model-applications/ |
| MITRE ATLAS | Adversarial Threat Landscape for AI Systems. Framework für ML-spezifische Angriffstechniken, Taktiken und Mitigations nach dem ATT&CK-Modell. | MITRE Corporation | https://atlas.mitre.org/ |
| NIST AI Risk Management Framework | Umfassendes Rahmenwerk für verantwortungsvollen AI-Einsatz. Governance, Risikobewertung, Trustworthiness-Prinzipien. | NIST (US) | https://www.nist.gov/itl/ai-risk-management-framework |
Detaillierte Zusammenfassungen dieser Standards bietet der KI-Security-Standards-Überblick.
Bonus: Infrastruktur & Tooling
Unterstützende Werkzeuge für sichere LLM-Entwicklung und -Betrieb.
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| LiteLLM | Unified API für 100+ LLM-Provider (OpenAI, Anthropic, Gemini, etc.). Erleichtert Fallback-Strategien und Vendor-Lock-In-Vermeidung. | MIT | https://github.com/BerriAI/litellm |
| vLLM | Hochperformante Inference-Engine für LLMs. PagedAttention-Algorithmus für effizienten Self-Hosting mit begrenzten Ressourcen. | Apache-2.0 | https://github.com/vllm-project/vllm |
| Ollama | Lokales LLM-Deployment leicht gemacht. Lädt und betreibt Llama, Mistral, Gemma etc. auf eigener Hardware — kein Cloud-Vendor nötig. | MIT | https://github.com/ollama/ollama |
| Llama.cpp | Effiziente C++-Implementierung für Llama-Modelle. Ermöglicht Inference auf Consumer-Hardware (sogar CPU) mit quantisierten Modellen. | MIT | https://github.com/ggerganov/llama.cpp |
| FastChat | Plattform zum Training, Serving und Evaluation von Chatbots basierend auf LLMs. Entwickelt vom Team hinter Vicuna und Chatbot Arena. | Apache-2.0 | https://github.com/lm-sys/FastChat |
| Haystack (Deepset) | End-to-End-Framework für Search- und QA-Systeme mit LLMs. RAG-Pipelines, Agent-Orchestrierung, Production-Ready. | Apache-2.0 | https://github.com/deepset-ai/haystack |
| Semantic Kernel (Microsoft) | SDK für Integration von LLMs in Apps (C#, Python, Java). Planner, Memory, Plugin-System — Fokus auf Enterprise-Anwendungen. | MIT | https://github.com/microsoft/semantic-kernel |
| LangChain | Meistgenutztes Framework für LLM-Anwendungen. Chains, Agents, Memory, VectorStores — starkes Ökosystem, aber Sicherheit muss selbst implementiert werden. | MIT | https://github.com/hwchase17/langchain |
| LlamaIndex | Daten-Framework für LLM-Anwendungen. Spezialisiert auf Indexing, Retrieval und RAG-Pipelines mit strukturierten/unstrukturierten Daten. | MIT | https://github.com/run-llama/llama_index |
Vektor-Datenbanken für sichere RAG-Systeme
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| Qdrant | Vektor-Datenbank in Rust mit Fokus auf Performance und Filtering. RBAC, Encryption-at-Rest, für Produktiv-RAG-Systeme geeignet. | Apache-2.0 | https://github.com/qdrant/qdrant |
| Weaviate | GraphQL-basierte Vektor-DB mit Hybrid-Search (Vektor + Keyword). Module für OpenAI, Cohere, Hugging Face-Embeddings. | BSD-3-Clause | https://github.com/weaviate/weaviate |
| Chroma | Embedding-Datenbank für AI-Anwendungen. Einfachste Integration, gut für Prototyping — für Produktion ggf. Qdrant/Weaviate erwägen. | Apache-2.0 | https://github.com/chroma-core/chroma |
| Milvus | Hochskalierbare Vektor-DB für Milliarden Embeddings. CUDA-Support, Cloud-Native, für Enterprise-RAG-Deployments. | Apache-2.0 | https://github.com/milvus-io/milvus |
| pgvector | PostgreSQL-Extension für Vektor-Ähnlichkeitssuche. Nutzt bestehende Postgres-Infrastruktur — kein Extra-System nötig. | PostgreSQL | https://github.com/pgvector/pgvector |
| pgvecto.rs | Postgres-Extension in Rust geschrieben. Schneller als pgvector, besonders bei großen Datenmengen. | Apache-2.0 | https://github.com/tensorchord/pgvecto.rs |
Data & ML-Ops
| Werkzeug | Beschreibung | Lizenz | URL |
|---|---|---|---|
| Label Studio | Open-Source Data-Labeling-Platform. Annotierung von Trainings- und Evaluationsdaten für LLM-Finetuning und RLHF. | Apache-2.0 | https://github.com/HumanSignal/label-studio |
| Argilla | Collaboration-Tool für Daten-Annotation und Model-Feedback. Speziell für LLM-Workflows (Prompt-Curation, Output-Review). | Apache-2.0 | https://github.com/argilla-io/argilla |
| Prefect | Workflow-Orchestrierung für Data Pipelines. Scheduling, Monitoring, Error-Handling für LLM-Batch-Jobs und Retraining. | Apache-2.0 | https://github.com/PrefectHQ/prefect |
| Dagster | Data-Orchestrator mit Asset-basiertem Ansatz. Software-defined Assets, Type-Checking, für komplexe LLM-Datenpipelines. | Apache-2.0 | https://github.com/dagster-io/dagster |
| Metaflow (Netflix) | ML-Infrastructure-Framework von Netflix. Versionierung, Experiment-Tracking, einfaches Deployment von ML/LLM-Workflows. | Apache-2.0 | https://github.com/Netflix/metaflow |
| ZenML | MLOps-Framework für reproduzierbare Pipelines. Integrations für alle gängigen ML-Tools, LLM-Stack-Unterstützung. | Apache-2.0 | https://github.com/zenml-io/zenml |
Mitmachen
Diese Liste wird von der FlowKI-Community gepflegt. Ergänzungen, Korrekturen oder neue Tool-Kategorien gerne im Discord melden oder als Pull-Request einreichen.
Wichtiger Hinweis: Vor dem Produktiveinsatz sollten Lizenzbedingungen, aktuelle Wartungsstatus und Security-Advisories der jeweiligen Projekte selbst geprüft werden. Open-Source-Projekte entwickeln sich schnell weiter.
Kuratiert von der FlowKI-Community | Stand: August 2026
// weiter geht's in der community
Fragen, Feedback, eigene Ergänzungen?
Dieses Freebie ist ein Startpunkt, kein Endpunkt. Im deutschsprachigen FlowKI-Club-Discord besprichst du deine Fälle mit anderen KI-Praktikern, bekommst Updates zu den Sammlungen zuerst und kannst eigene Beiträge einbringen.
Zur FlowKI-Community →