> ## Documentation Index
> Fetch the complete documentation index at: https://docs.pioneer.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Pioneer-Modellkatalog: Encoder, Decoder und Inferenz

> Durchsuchen Sie die Encoder- (GLiNER) und Decoder-Modelle (LLM) von Pioneer für Fine-Tuning und Inferenz. Behandelt On-Demand vs. Serverless.

Pioneer unterstützt zwei Modellfamilien: **Encoder-Modelle** (GLiNER) für strukturierte Extraktionsaufgaben wie Named Entity Recognition und **Decoder-Modelle** (LLMs) für Textgenerierung, Klassifikation und offenes Prompting. Die folgenden Tabellen sind eine Momentaufnahme des aktuellen Katalogs – verwenden Sie `GET /base-models`, um die Live-Liste abzufragen, die immer die aktuelle Verfügbarkeit und Fähigkeiten widerspiegelt.

Einige Modelle in Rollout-Phasen sind funktions-gated. Sie erscheinen im Live-Katalog nur für Workspaces, für die der entsprechende Rollout aktiviert ist.

## Encoder-Modelle (GLiNER)

GLiNER-Modelle führen Named Entity Recognition und strukturierte Extraktion durch. Die meisten GLiNER-Basismodelle unterstützen sowohl Training als auch On-Demand-Inferenz nach dem Training. Preise sind pro 1 Mio. Tokens.

| Model ID                                   | Label                              | Input  | Output | Training   | Inferenz              |
| :----------------------------------------- | :--------------------------------- | :----- | :----- | :--------- | :-------------------- |
| `fastino/gliner2-base-v1`                  | GLiNER2 Base                       | \$0.15 | \$0.15 | LoRA, Full | Serverless, On-demand |
| `fastino/gliner2-large-v1`                 | GLiNER2 Large                      | \$0.15 | \$0.15 | LoRA, Full | Serverless, On-demand |
| `fastino/gliner2-multi-v1`                 | GLiNER2 Multi                      | \$0.15 | \$0.15 | LoRA, Full | Serverless, On-demand |
| `fastino/gliner2-multi-large-v1`           | GLiNER2 Multi Large                | \$0.15 | \$0.15 | LoRA, Full | Serverless, On-demand |
| `fastino/gliguard-LLMGuardrails-300M`      | GLiGuard LLM Guardrails 300M       | \$0.15 | \$0.15 | —          | Serverless            |
| `fastino/gliner2-privacy-filter-PII-multi` | GLiNER2 Privacy Filter PII (Multi) | \$0.15 | \$0.15 | —          | Serverless            |
| `fastino/gliguard-PII-multi`               | GLiNER2-Guardrails-PII-Multi       | \$0.15 | \$0.15 | —          | Serverless            |

`fastino/gliner2-multi-v1` und `fastino/gliner2-multi-large-v1` sind mehrsprachige Varianten, die für nicht-englische Texte geeignet sind.

## Decoder-Modelle — Training

LoRA-Fine-Tuning über `POST /felix/training-jobs` ist auf die Nemotron-3.5-Lightning-Familie begrenzt:

| Model ID                                            | Label                                     | Training |
| :-------------------------------------------------- | :---------------------------------------- | :------- |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            | LoRA     |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    | LoRA     |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare | LoRA     |

Für neue Trainingsjobs stehen die Nemotron-3.5-Lightning-Familie sowie die trainierbaren GLiNER-Basismodelle zur Verfügung. Die oben aufgeführten PII- und GLiGuard-Varianten sind reine Serverless-Inferenzziele. Fragen Sie vor dem Absenden eines Jobs `GET /base-models?supports_training=true` ab; dies ist die Live-Quelle für die Verfügbarkeit.

## Decoder-Modelle — Serverless-Inferenz

Dies sind die unterstützten vorab bereitgestellten Inferenzfamilien. Fragen Sie `GET /base-models?supports_inference=true` für Live-Verfügbarkeit, Kontextlimits und Preise ab.

### Nemotron 3.5 Lightning

| Model ID                                            | Label                                     |
| --------------------------------------------------- | ----------------------------------------- |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare |

### Anthropic

| Model ID          | Label           |
| ----------------- | --------------- |
| `claude-opus-5`   | Claude Opus 5   |
| `claude-sonnet-5` | Claude Sonnet 5 |
| `claude-haiku-5`  | Claude Haiku 5  |

### OpenAI

| Model ID        | Label         |
| --------------- | ------------- |
| `gpt-5.5`       | GPT-5.5       |
| `gpt-5.6-luna`  | GPT-5.6 Luna  |
| `gpt-5.6-terra` | GPT-5.6 Terra |
| `gpt-5.6-sol`   | GPT-5.6 Sol   |

### DeepSeek

| Model ID                        | Label             |
| ------------------------------- | ----------------- |
| `deepseek-ai/DeepSeek-V4-Flash` | DeepSeek V4 Flash |

### Z.ai

| Model ID               | Label        |
| ---------------------- | ------------ |
| `zai-org/GLM-5.2`      | GLM 5.2      |
| `zai-org/GLM-5.2-Fast` | GLM 5.2 Fast |

<Note>
  Modelle außerhalb dieser Familien werden nicht als Inferenzziele unterstützt. Verwenden Sie vor der Integration `GET /base-models` für den Live-Katalog und den Lifecycle-Status.
</Note>

## Prompt-Caching

Viele Serverless-Modelle rechnen gecachte Input-Tokens mit einem Rabatt ab, und einige Anbieter berechnen einen einmaligen Aufpreis, um Tokens in den Cache zu schreiben. Pioneer reicht die veröffentlichten Cache-Raten jedes Anbieters direkt durch – dies sind dieselben Raten, die `GET /base-models` als `cache_read_price_per_million` und `cache_write_price_per_million` zurückgibt, und dieselben Raten, die Pioneer Ihnen berechnet.

Cache-Raten werden aus der Input-Rate jedes Modells anhand der folgenden Multiplikatoren abgeleitet. Wo ein Anbieter keine separate Cache-Write-Position hat, werden Cache-Writes zur regulären Input-Rate abgerechnet.

| Anbieter               | Cache-Read | Cache-Write                                   |
| ---------------------- | ---------- | --------------------------------------------- |
| Anthropic (Claude)     | 0,1× Input | 1,25× Input                                   |
| OpenAI (GPT-5-Familie) | 0,1× Input | Input-Rate (1,25× bei GPT-5.6 Luna/Sol/Terra) |

Fragen Sie den Live-Katalog für exakte Cache-Raten ab. Jedes Modell ohne expliziten Cache-Rabatt rechnet gecachten Input zur regulären Input-Rate ab.

## On-Demand vs. Serverless-Inferenz

Pioneer bietet zwei Möglichkeiten, Vorhersagen zu bedienen, und die richtige Wahl hängt von Ihrem Workflow ab.

**Serverless**-Inferenz verwendet vorab bereitgestellte Basismodell-Endpunkte. Es gibt keine Startverzögerung und Sie werden pro Token abgerechnet. Dies ist ideal, wenn Sie ein Spitzenmodell aufrufen möchten, ohne Fine-Tuning durchzuführen.

**On-Demand**-Inferenz stellt nach Abschluss des Fine-Tunings eine dedizierte GPU bereit. Ihr LoRA-Adapter wird auf die GPU geladen und exklusiv für Ihre Anfragen bereitgestellt. Pioneer leitet Inferenzaufrufe automatisch an ein On-Demand-Deployment weiter, wenn Sie eine Trainingsjob-ID als `model_id` übergeben.

## Abfrage des Live-Katalogs

Die obigen Tabellen können neu hinzugefügten Modellen hinterherhinken. Verwenden Sie `GET /base-models`, um den aktuellen Katalog zur Laufzeit abzurufen.

```bash theme={null}
# Alle Modelle
curl https://api.pioneer.ai/base-models \
  -H "X-API-Key: YOUR_API_KEY"

# Nur Modelle, die Inferenz unterstützen
curl "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Nur Modelle, die Training unterstützen
curl "https://api.pioneer.ai/base-models?supports_training=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Nach Modellfamilie filtern
curl "https://api.pioneer.ai/base-models?task_type=encoder" \
  -H "X-API-Key: YOUR_API_KEY"

curl "https://api.pioneer.ai/base-models?task_type=decoder" \
  -H "X-API-Key: YOUR_API_KEY"
```

Jeder Eintrag in der Antwort enthält die Modell-ID, ihr Anzeige-Label, die Kontextlänge, Raten pro 1 Mio. Tokens (`input_price_per_million`, `output_price_per_million`, `cache_read_price_per_million`, `cache_write_price_per_million`) sowie Boolean-Flags für `supports_training` und `supports_inference`. Verwenden Sie den Modell-ID-Wert direkt in Trainingsjob-Anfragen und Inferenzaufrufen.

Um jedes Modell zusammen mit seinen Input-, Output- und Cache-Raten aufzulisten:

```bash theme={null}
curl -s "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY" \
| jq -r '["model","input/M","output/M","cache_read/M","cache_write/M"],
    (.models[] | [.id, .input_price_per_million, .output_price_per_million,
      .cache_read_price_per_million, .cache_write_price_per_million]) | @tsv' \
| column -t -s $'\t'
```
