Souveräne KI-Infrastruktur
The Sovereign
AI Gateway.
Ein Endpunkt zu allen KI-Modellen, betrieben in Europa, mit nutzungsbasierter Abrechnung.
Mit 5 € Startguthaben direkt loslegen.
- Schnittstelle zu allen Modellen
- 1 Schnittstelle zu allen Modellen
- Zeile Code zur Integration
- 1 Zeile Code zur Integration
- Monate Wartezeit auf Verträge
- 0 Monate Wartezeit auf Verträge
01 · Kontrolle
Startet wie ein Prototyp.
Skaliert bis Enterprise-Compliance.
Einmal integriert, entscheidest du jederzeit neu, welches Modell du wo nutzt und was es kosten darf.
Enterprise Quotas.
Rechenkapazität in Europa ist begrenzt. Mit uns startest du direkt mit Enterprise Availability.
Deterministic Failover.
Automatischer Wechsel bei Ausfall — strikt innerhalb deiner Compliance-Leitplanken.
Hard EU Residency.
Geografisch garantierte Endpunkte. Kein stilles Routing in Ausweichregionen.
Granular Budgeting.
Automatische Hard Caps pro Key für saubere Kostenrechnung pro Projekt oder Kunde.
So sieht das im Account aus
key_mandanten
- Anbieter
- nur mit § 203-Vereinbarung
- Region
- Deutschland
- Maskierung
- an
key_entwicklung
- Modelle
- nur Open Source
- Region
- EU
- Maskierung
- aus
key_marketing
- Anbieter
- alle im Katalog
- Modelle
- alle frei
- Maskierung
- aus
Modelle & Provider
Ein Zugang zu einer großen Modellauswahl.
Die OpenAI-kompatible API ermöglicht den Zugriff auf Modelle verschiedener Provider — mit transparenter Datenresidenz. Wir ersetzen eigene Konten und Verträge durch einen zentralisierten Zugang.
52 Modelle · 7 Anbieter · Residenz DE/EU
Integration
Drop-In Replacement für alle OpenAI kompatible Anwendungen.
Nach einmaliger Konfiguration übernehmen wir das Routing, alles andere ist wie gehabt.
- Kompatibel mit allen OpenAI-SDKs
- Keys können auf Provider und/oder Modelle beschränkt werden
- Smartes Routing inklusive
from openai import OpenAI
client = OpenAI(
# eine Zeile — mehr nicht
base_url="https://api.noirdoc.de/v1",
api_key=os.environ["NOIRDOC_KEY"],
)
response = client.chat.completions.create(
model="gpt-5.4", # Anbieter & Modell
messages=[{"role": "user", "content": "Hallo"}],
) 02 · Compliance
Gebaut für Verschwiegenheit.
AVV, Verschwiegenheitserklärung und Zero Data Retention sind bei uns Standard — damit sogar Anwälte, Steuerberater und Ärzte bedenkenlos arbeiten können.
By Contract.
AVV nach DSGVO und Verschwiegenheitserklärung nach § 203 StGB gehören zum Standardvertrag. Erfüllen Anbieter die Anforderungen für Berufsgeheimnisträger nicht, filtern wir sie raus.
- AVV · beim Zugang
- § 203 · gegengezeichnet
- deutsches Recht
By Architecture.
Durch Zero Data Retention werden Inhalte bei uns nicht gespeichert und nicht fürs Training genutzt. Jede Anfrage wird protokolliert und auf Wunsch werden personenbezogene Daten zu <<PERSON_1>> maskiert, bevor sie das Modell erreichen.
Mask Docs →03 · Preise
Listenpreis ohne Aufschlag.
Du zahlst nur, was du benutzt — und auch nur zu den Listenpreisen der Anbieter.
Live-Abrechnung.
Kosten sind minutengenau sichtbar im Account.
Budget pro API-Key.
Jeder API-Key bekommt ein Budget, bei dem wir Kosten sofort stoppen.
Günstigere Modelle.
Nun nutze das richtige Modell für den jeweiligen Task.
- Aufschlag, Grundgebühr, Mindestabnahme
- 0 € Aufschlag, Grundgebühr, Mindestabnahme
- für AVV und § 203-Vereinbarung
- 0 € für AVV und § 203-Vereinbarung
- Base-URL zurücktauschen, fertig
- Kein Lock-in Base-URL zurücktauschen, fertig
Der Katalog.
41 Modelle
Stärkstes Modell der GPT-5.6-Familie — extended Reasoning, agentische Workflows und Code für anspruchsvollste Workloads.
Ausgewogenes Modell der 5.6-Familie — Leistung auf GPT-5.5-Niveau zu deutlich geringeren Kosten.
Schnellstes und günstigstes 5.6-Modell — für hohe Volumina und latenzkritische Anwendungen.
Frontier-Modell für anspruchsvolles Reasoning, agentische Workflows und komplexe Produktionslasten.
Kompakte GPT-5.4-Variante für hohe Durchsätze zu geringen Kosten — solide bei Standardaufgaben.
Kompakte GPT-5-Variante für hohe Durchsätze zu geringen Kosten — solide bei Standardaufgaben.
Offenes Schweizer Modell, transparent trainiert — guter Generalist mit europäischem Fokus.
OpenAIs open-weight Modell — frontiernahes Reasoning bei voller Deployment-Kontrolle.
Googles offene Reihe als effizientes MoE — günstig für Chat und einfache Tool-Aufgaben.
Großes offenes Modell der GLM-Reihe — auf anspruchsvolles Reasoning und agentische Aufgaben ausgelegt.
Kleines, schnelles Llama — ideal für günstige, latenzkritische Massenaufgaben.
Robuster Open-Weight-Generalist mit gutem Preis-Leistungs-Verhältnis für breite Workloads.
Europäisches Flaggschiff von Mistral — leistungsstarker Generalist für breite Produktionslasten.
Effizientes Qwen-MoE — stark bei Mehrsprachigkeit und Reasoning zu niedrigen Kosten.
Effizientes Qwen-MoE — stark bei Mehrsprachigkeit und Reasoning zu niedrigen Kosten.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Kleines, schnelles Llama — ideal für günstige, latenzkritische Massenaufgaben.
Kompaktes Mistral-Modell mit 128k-Kontext — solide für Chat und Zusammenfassungen.
Mittelgroßer Allrounder — verlässliche Qualität für alltägliche Text- und Chataufgaben.
OpenAIs open-weight Modell — frontiernahes Reasoning bei voller Deployment-Kontrolle.
Robuster Open-Weight-Generalist mit gutem Preis-Leistungs-Verhältnis für breite Workloads.
Größtes Llama-Modell — höchste Qualität für komplexe Aufgaben, DE-gehostet.
Googles Flash-Modell der aktuellen Gemini-Generation — auf Tempo und hohe Durchsätze ausgelegt.
Kompakte Flash-Variante für einfache, sehr häufige Aufgaben — auf niedrige Latenz getrimmt.
Ältere Flash-Lite-Generation — stabil für bestehende Integrationen und einfache Massenaufgaben.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Kompaktes Qwen-Modell mit 27B Parametern — ausgewogener Generalist für Chat, Reasoning und Tool-Aufrufe.
Großes Qwen-MoE mit 122B Parametern, davon rund 10B aktiv — starkes Reasoning bei schlankem Rechenaufwand.
Großes Qwen-MoE mit 122B Parametern, davon rund 10B aktiv — starkes Reasoning bei schlankem Rechenaufwand.
Schnelle Variante der DeepSeek-V4-Reihe — Generalist mit Stärken bei Code und Analyse.
Schnelle Variante der DeepSeek-V4-Reihe — Generalist mit Stärken bei Code und Analyse.
Schnelle Variante der DeepSeek-V4-Reihe — Generalist mit Stärken bei Code und Analyse.
Googles offene Gemma-Reihe in der 31B-Instruct-Variante — solider Generalist für Chat und Textarbeit.
Aktuelle Generation der Kimi-Reihe von Moonshot AI — großes Reasoning-Modell für agentische Aufgaben.
Anthropics Mythos-Klasse — für autonome Wissensarbeit, lange Refactorings und agentische Abläufe über viele Schritte.
Anthropics stärkstes Opus-Modell — für langlaufende Agenten, komplexe Migrationen und anspruchsvollste Reasoning-Aufgaben.
Das Arbeitspferd der Claude-Familie — starkes Coding und Reasoning zu einem sehr guten Preis-Leistungs-Verhältnis.
Schnellstes Claude-Modell — für hohe Volumina, Klassifikation und latenzkritische Anwendungen.
Spezialisiertes Code-Modell für Generierung, Refactoring und agentische Dev-Workflows.
Schnelle Text-zu-Bild-Generierung — auf kurze Wartezeiten und hohe Volumina ausgelegt.
Neue FLUX-Generation für Text-zu-Bild — kompaktes Modell für schnelle Bildgenerierung.
Neue FLUX-Generation für Text-zu-Bild — kompaktes Modell für schnelle Bildgenerierung.
Bildbearbeitung der FLUX.2-Reihe — gezielte Änderungen an bestehenden Bildern per Prompt.
OpenAIs Spracherkennung — robuste Transkription über viele Sprachen und Akzente hinweg.
OpenAIs Sprachsynthese — natürlich klingende Stimmen für Vorlesefunktionen, Ansagen und Assistenten.
Text-zu-Sprache in höherer Audioqualität — für Produktionen, in denen die Stimme im Vordergrund steht.
OpenAIs Spracherkennung — robuste Transkription über viele Sprachen und Akzente hinweg.
Mehrsprachige Embeddings für Ähnlichkeitssuche und RAG — kompakt und schnell.
Starke englische Embeddings für hochwertige Retrieval-Pipelines.
Mehrsprachiges Embedding-Modell mit langem Kontext — vielseitig für RAG.
Großes multimodales Embedding-Modell für anspruchsvolle Such- und RAG-Anwendungen.
Reranker für präzisere Treffer in RAG-Pipelines — ordnet Suchergebnisse neu.
Embedding-Modell auf Mistral-7B-Basis — hochwertige Vektoren für Retrieval und RAG-Pipelines.
Für diesen Anbieter sind keine Modelle gelistet.
Vision-OCR — wandelt Dokumente, Rechnungen und Tabellen in Markdown, LaTeX oder JSON.
Jetzt loslegen.
Mit 5 € Startguthaben direkt auf alle Modelle zugreifen. Fragen vorab klärt der Vertrieb im Gespräch.
Unser Angebot richtet sich ausschließlich an Gewerbetreibende, nicht an Endverbraucher. Alle Preise verstehen sich zuzüglich gesetzlicher Umsatzsteuer.
Was uns antreibt
Souverän sein, bedeutet
nicht abhängig zu sein.
Künstliche Intelligenz entscheidet künftig mit — über Prozesse, Mandate, Diagnosen, ganze Branchen. Wer sie unkontrolliert nutzt, liefert sich mit seinen Daten und Know-How an wenige Konzerne außerhalb Europas aus.
Fortschritt darf keine Frage der Abhängigkeit sein. Deshalb bauen wir noirdoc — von München aus, damit jedes Unternehmen KI sicher und flexibel einsetzen kann.
Kontakt
Bereit für den nächsten Schritt?
Egal welche Modelle und welche Residenz du brauchst — wir machen es möglich.
Jetzt loslegen →Fragen vorab? Vertrieb kontaktieren oder schreib uns: hello@noirdoc.de — wir antworten in der Regel innerhalb eines Werktags.