flowki@club:~$ Gerade gestartet · sei von Anfang an dabei

// kuratierte toolbox / defensive KI-Security

Deutsche LLM-Security-Toolbox (50+)

Die englische Community hat großartige LLM-Security-Sammlungen — auf Deutsch fehlte eine praxisnahe, gepflegte Übersicht. Diese Toolbox schließt die Lücke: über 50 frei nutzbare Werkzeuge nach Kategorie, mit Lizenz und deutscher Einordnung. Alle Links geprüft.

Eine kuratierte Sammlung von 50+ frei nutzbaren Open-Source-Werkzeugen zur Absicherung von LLM-Anwendungen. Diese Liste richtet sich an Entwickler, die ihre eigenen KI-Systeme härten, testen und überwachen möchten.

Wichtig: Alle hier aufgeführten Tools dienen der defensiven Sicherheit — dem Testen, Härten und Überwachen der eigenen Anwendungen. Diese Liste enthält keine Angriffswerkzeuge oder Anleitungen zum Kompromittieren fremder Systeme.

Kuratiert von der FlowKI-Community. Stand der URLs und Lizenzen sollte vor Produktiveinsatz selbst geprüft werden, da sich Open-Source-Projekte weiterentwickeln.


1. Scanner & Red-Team-Frameworks

Werkzeuge zum systematischen Testen von LLM-Anwendungen auf Schwachstellen — ähnlich wie Penetrationstests bei klassischen Web-Apps.

Werkzeug Beschreibung Lizenz URL
garak LLM-Vulnerability-Scanner der neuesten Generation von Leon Derczynski. Testet auf Prompt-Injection, Jailbreaks, Halluzinationen, toxische Outputs und mehr. Apache-2.0 https://github.com/leondz/garak
PyRIT Python Risk Identification Toolkit von Microsoft Azure. Framework für Red-Teaming von generativen KI-Systemen mit automatisierten Adversarial-Prompts. MIT https://github.com/Azure/PyRIT
promptfoo Testing-Framework für LLM-Outputs mit Assertion-Library, Regression-Testing und automatischen Red-Team-Scans. Unterstützt OpenAI, Anthropic, Llama und mehr. MIT https://github.com/promptfoo/promptfoo
Giskard End-to-End-Testing für ML-Modelle und LLMs. Automatische Erkennung von Performance-Problemen, Bias, ethischen Risiken und Robustheitslücken. Apache-2.0 https://github.com/Giskard-AI/giskard
deepeval Evaluation-Framework für LLMs mit Metriken wie Hallucination-Score, Answer-Relevance, Faithfulness und Toxicity. Integriert sich in pytest. Apache-2.0 https://github.com/confident-ai/deepeval
OpenAI Evals Offizielles Evaluation-Framework von OpenAI. Registry von Test-Datasets und Metriken zur Bewertung von LLM-Fähigkeiten und Sicherheit. MIT https://github.com/openai/evals

2. Guardrails & Laufzeit-Filter

Frameworks die während der Laufzeit Input und Output von LLMs validieren, filtern und absichern.

Werkzeug Beschreibung Lizenz URL
LLM Guard (Protectai) Production-ready Guardrails-Toolkit mit 25+ Scannern für Input/Output-Validierung. Erkennt PII, Toxicity, Code-Injection, Prompt-Leaks uvm. MIT https://github.com/protectai/llm-guard
Rebuff (Protectai) Self-hardening Prompt-Injection-Detector. Nutzt LLMs zur Erkennung von Injections, Heuristics und Vektor-Datenbank für bekannte Muster. Apache-2.0 https://github.com/protectai/rebuff
NeMo Guardrails (NVIDIA) Toolkit zum Hinzufügen programmierbarer Leitplanken für LLM-Anwendungen. Colang-DSL für sicherheitskritische Dialoglenkung. Apache-2.0 https://github.com/NVIDIA/NeMo-Guardrails
Guardrails AI Validerung und Strukturierung von LLM-Outputs über RAIL-Spec (Reliable AI Markup Language). Prüft Schema-Konformität, PII-Leaks, Bias. Apache-2.0 https://github.com/guardrails-ai/guardrails
LLM Guard (Laiyer AI) Weitere Guardrails-Implementierung mit Fokus auf Enterprise-Anforderungen. Modular aufgebaut, integriert sich in Langchain und Llama Index. MIT https://github.com/laiyer-ai/llm-guard
Guidance (Microsoft) Framework zur Steuerung von LLM-Generierung mit Constraints. Verhindert unerwünschte Outputs durch strukturierte Generation statt nachträglichem Filtern. MIT https://github.com/microsoft/guidance
Outlines Strukturierte Text-Generierung mit formalen Grammatiken (JSON-Schema, Regex). Garantiert valide Outputs ohne Post-Processing. Apache-2.0 https://github.com/outlines-dev/outlines
Instructor Strukturierte Output-Extraktion aus LLMs mit Pydantic-Modellen. Type-Safe und validiert Outputs automatisch gegen Schemas. MIT https://github.com/jxnl/instructor

3. Prompt-Injection- & Jailbreak-Detektion

Spezialisierte Werkzeuge zur Erkennung von Prompt-Injections, Jailbreaks und adversarialen Eingaben.

Werkzeug Beschreibung Lizenz URL
Rebuff (siehe oben unter Guardrails — primärer Use-Case ist Prompt-Injection-Detection) Apache-2.0 https://github.com/protectai/rebuff
LLM Guard PII-Scanner Teil des LLM-Guard-Toolkits, speziell für Erkennung von persönlichen Daten in User-Prompts vor Weiterleitung an LLM. MIT https://github.com/protectai/llm-guard
Lakera Gandalf Interaktive Übungsumgebung für Prompt-Injection-Techniken. Spielerisch lernen, welche Angriffe funktionieren (und wie man sie abwehrt). https://lakera.ai/gandalf

Weitere Ressourcen zu Prompt-Injection und Jailbreaks finden sich im KI-Security-Standards-Überblick.


4. Evaluation & Testing

Frameworks zur systematischen Bewertung von LLM-Qualität, Korrektheit und Robustheit — unverzichtbar für sichere Produktivsysteme.

Werkzeug Beschreibung Lizenz URL
RAGAS RAG-Assessment-Framework für Retrieval-Augmented-Generation-Systeme. Misst Context-Relevance, Faithfulness, Answer-Relevance ohne Ground-Truth. Apache-2.0 https://github.com/explodinggradients/ragas
TruLens Evaluation und Tracking für LLM-Apps. Instrumentation für Langchain/LlamaIndex mit Feedback-Functions für Hallucination, Groundedness, Relevance. MIT https://github.com/truera/trulens
deepeval (siehe oben unter Scanner — auch starkes Evaluation-Framework) Apache-2.0 https://github.com/confident-ai/deepeval
Giskard (siehe oben unter Scanner — auch umfangreiche Evaluation-Metriken) Apache-2.0 https://github.com/Giskard-AI/giskard
EleutherAI LM Evaluation Harness Standard-Benchmark-Suite für Language-Models. Misst Performance auf akademischen Tasks (MMLU, TruthfulQA, etc.). MIT https://github.com/EleutherAI/lm-evaluation-harness
Hugging Face Evaluate Unified Evaluation-Library mit 100+ Metriken für NLP, Vision, Audio. Integriert in Hugging Face Transformers-Ökosystem. Apache-2.0 https://github.com/huggingface/evaluate
UpTrain Open-Source Tool für LLM-Evaluation und Observability. Checkt Response-Qualität, Hallucinations, Bias, Language-Quality in Prod. Apache-2.0 https://github.com/uptrain-ai/uptrain

5. Monitoring & Observability

Tools zur Überwachung von LLM-Anwendungen im Produktivbetrieb — erkennen Anomalien, Performance-Probleme und Sicherheitsvorfälle.

Werkzeug Beschreibung Lizenz URL
Langfuse Open-Source LLM-Engineering-Platform. Tracing, Prompt-Management, Evaluations, User-Feedback und Analytics für Produktiv-LLMs. MIT https://github.com/langfuse/langfuse
Helicone Open-Source Observability-Platform für LLM-APIs (OpenAI, Anthropic, etc.). Request-Logging, Caching, Rate-Limiting, Cost-Tracking. Apache-2.0 https://github.com/Helicone/helicone
Arize Phoenix ML-Observability-Tool mit starkem LLM-Fokus. Tracing für LangChain/LlamaIndex, Embedding-Visualisierung, Drift-Detection. Apache-2.0 https://github.com/Arize-ai/phoenix
LangSmith (Langchain) Offizielle Langchain-Observability-Plattform. Debugging, Testing, Evaluations und Monitoring für Langchain-Anwendungen. MIT https://github.com/langchain-ai/langsmith-sdk
WhyLabs Data-Logging-Framework mit LLM-Support. Erkennt Prompt-Injection-Versuche, Toxic-Outputs, PII-Leaks in Produktions-Traffic. Apache-2.0 https://github.com/whylabs/whylogs
MLflow Klassisches ML-Lifecycle-Management mit LLM-Tracking. Experiment-Tracking, Model-Registry, Deployment — nun auch für LLMs. Apache-2.0 https://github.com/mlflow/mlflow
Weights & Biases Experiment-Tracking und Visualisierung für ML/AI. LLM-Prompts, Outputs und Evaluations loggen und vergleichen. Apache-2.0 https://github.com/wandb/wandb

6. Übungs-Umgebungen & Training

Sichere Sandboxes zum Lernen von LLM-Security ohne Produktivrisiko.

Werkzeug Beschreibung Lizenz URL
Lakera Gandalf (siehe oben unter Prompt-Injection-Detection) Interaktives Prompt-Injection-Training mit 7 Level-Schwierigkeiten. https://lakera.ai/gandalf
Protectai AI-Exploits Sammlung von dokumentierten AI/ML-Security-Vorfällen und Exploit-Beispielen zur Schulung und Awareness. Apache-2.0 https://github.com/protectai/ai-exploits

Weitere praktische Anleitungen zum sicheren Aufbau von LLM-Systemen finden sich im KI-Security-Kit.


7. Standards & Referenzen

Offizielle Sicherheitsstandards, Frameworks und Richtlinien für LLM-Anwendungen.

Ressource Beschreibung Herausgeber URL
OWASP Top 10 für LLMs Die zehn kritischsten Sicherheitsrisiken bei Large Language Model-Anwendungen. Referenz-Standard der Branche, analog zu OWASP Top 10 für Web-Apps. OWASP Foundation https://owasp.org/www-project-top-10-for-large-language-model-applications/
MITRE ATLAS Adversarial Threat Landscape for AI Systems. Framework für ML-spezifische Angriffstechniken, Taktiken und Mitigations nach dem ATT&CK-Modell. MITRE Corporation https://atlas.mitre.org/
NIST AI Risk Management Framework Umfassendes Rahmenwerk für verantwortungsvollen AI-Einsatz. Governance, Risikobewertung, Trustworthiness-Prinzipien. NIST (US) https://www.nist.gov/itl/ai-risk-management-framework

Detaillierte Zusammenfassungen dieser Standards bietet der KI-Security-Standards-Überblick.


Bonus: Infrastruktur & Tooling

Unterstützende Werkzeuge für sichere LLM-Entwicklung und -Betrieb.

Werkzeug Beschreibung Lizenz URL
LiteLLM Unified API für 100+ LLM-Provider (OpenAI, Anthropic, Gemini, etc.). Erleichtert Fallback-Strategien und Vendor-Lock-In-Vermeidung. MIT https://github.com/BerriAI/litellm
vLLM Hochperformante Inference-Engine für LLMs. PagedAttention-Algorithmus für effizienten Self-Hosting mit begrenzten Ressourcen. Apache-2.0 https://github.com/vllm-project/vllm
Ollama Lokales LLM-Deployment leicht gemacht. Lädt und betreibt Llama, Mistral, Gemma etc. auf eigener Hardware — kein Cloud-Vendor nötig. MIT https://github.com/ollama/ollama
Llama.cpp Effiziente C++-Implementierung für Llama-Modelle. Ermöglicht Inference auf Consumer-Hardware (sogar CPU) mit quantisierten Modellen. MIT https://github.com/ggerganov/llama.cpp
FastChat Plattform zum Training, Serving und Evaluation von Chatbots basierend auf LLMs. Entwickelt vom Team hinter Vicuna und Chatbot Arena. Apache-2.0 https://github.com/lm-sys/FastChat
Haystack (Deepset) End-to-End-Framework für Search- und QA-Systeme mit LLMs. RAG-Pipelines, Agent-Orchestrierung, Production-Ready. Apache-2.0 https://github.com/deepset-ai/haystack
Semantic Kernel (Microsoft) SDK für Integration von LLMs in Apps (C#, Python, Java). Planner, Memory, Plugin-System — Fokus auf Enterprise-Anwendungen. MIT https://github.com/microsoft/semantic-kernel
LangChain Meistgenutztes Framework für LLM-Anwendungen. Chains, Agents, Memory, VectorStores — starkes Ökosystem, aber Sicherheit muss selbst implementiert werden. MIT https://github.com/hwchase17/langchain
LlamaIndex Daten-Framework für LLM-Anwendungen. Spezialisiert auf Indexing, Retrieval und RAG-Pipelines mit strukturierten/unstrukturierten Daten. MIT https://github.com/run-llama/llama_index

Vektor-Datenbanken für sichere RAG-Systeme

Werkzeug Beschreibung Lizenz URL
Qdrant Vektor-Datenbank in Rust mit Fokus auf Performance und Filtering. RBAC, Encryption-at-Rest, für Produktiv-RAG-Systeme geeignet. Apache-2.0 https://github.com/qdrant/qdrant
Weaviate GraphQL-basierte Vektor-DB mit Hybrid-Search (Vektor + Keyword). Module für OpenAI, Cohere, Hugging Face-Embeddings. BSD-3-Clause https://github.com/weaviate/weaviate
Chroma Embedding-Datenbank für AI-Anwendungen. Einfachste Integration, gut für Prototyping — für Produktion ggf. Qdrant/Weaviate erwägen. Apache-2.0 https://github.com/chroma-core/chroma
Milvus Hochskalierbare Vektor-DB für Milliarden Embeddings. CUDA-Support, Cloud-Native, für Enterprise-RAG-Deployments. Apache-2.0 https://github.com/milvus-io/milvus
pgvector PostgreSQL-Extension für Vektor-Ähnlichkeitssuche. Nutzt bestehende Postgres-Infrastruktur — kein Extra-System nötig. PostgreSQL https://github.com/pgvector/pgvector
pgvecto.rs Postgres-Extension in Rust geschrieben. Schneller als pgvector, besonders bei großen Datenmengen. Apache-2.0 https://github.com/tensorchord/pgvecto.rs

Data & ML-Ops

Werkzeug Beschreibung Lizenz URL
Label Studio Open-Source Data-Labeling-Platform. Annotierung von Trainings- und Evaluationsdaten für LLM-Finetuning und RLHF. Apache-2.0 https://github.com/HumanSignal/label-studio
Argilla Collaboration-Tool für Daten-Annotation und Model-Feedback. Speziell für LLM-Workflows (Prompt-Curation, Output-Review). Apache-2.0 https://github.com/argilla-io/argilla
Prefect Workflow-Orchestrierung für Data Pipelines. Scheduling, Monitoring, Error-Handling für LLM-Batch-Jobs und Retraining. Apache-2.0 https://github.com/PrefectHQ/prefect
Dagster Data-Orchestrator mit Asset-basiertem Ansatz. Software-defined Assets, Type-Checking, für komplexe LLM-Datenpipelines. Apache-2.0 https://github.com/dagster-io/dagster
Metaflow (Netflix) ML-Infrastructure-Framework von Netflix. Versionierung, Experiment-Tracking, einfaches Deployment von ML/LLM-Workflows. Apache-2.0 https://github.com/Netflix/metaflow
ZenML MLOps-Framework für reproduzierbare Pipelines. Integrations für alle gängigen ML-Tools, LLM-Stack-Unterstützung. Apache-2.0 https://github.com/zenml-io/zenml

Mitmachen

Diese Liste wird von der FlowKI-Community gepflegt. Ergänzungen, Korrekturen oder neue Tool-Kategorien gerne im Discord melden oder als Pull-Request einreichen.

Wichtiger Hinweis: Vor dem Produktiveinsatz sollten Lizenzbedingungen, aktuelle Wartungsstatus und Security-Advisories der jeweiligen Projekte selbst geprüft werden. Open-Source-Projekte entwickeln sich schnell weiter.


Kuratiert von der FlowKI-Community | Stand: August 2026

// weiter geht's in der community

Fragen, Feedback, eigene Ergänzungen?

Dieses Freebie ist ein Startpunkt, kein Endpunkt. Im deutschsprachigen FlowKI-Club-Discord besprichst du deine Fälle mit anderen KI-Praktikern, bekommst Updates zu den Sammlungen zuerst und kannst eigene Beiträge einbringen.

Zur FlowKI-Community →