Weblabs AI

Weblabs AI API

OpenAI-kompatibler Endpunkt mit GPU-Backend — einfach Base-URL tauschen, fertig.

8
Modelle
GPU
Backend
OpenAI
Kompatibel
Quickstart

In 30 Sekunden loslegen

import OpenAI from "openai"; const client = new OpenAI({ baseURL: "https://ai.weareweblabs.com/v1", apiKey: "sk-dein-api-key", }); const res = await client.chat.completions.create({ model: "qwen3.5:4b", messages: [{ role: "user", content: "Schreib ein Rezept für Tiramisu" }], }); console.log(res.choices[0].message.content);
Authentifizierung

API-Key

Header: x-api-key: sk-... oder Authorization: Bearer sk-...  ·  Keys verwalten im Admin-Dashboard.

Modelle

Verfügbare Modelle

Modell-IDFähigkeitenBackendGeschwindigkeit
qwen3.5:4bText + BildWL GPUSchnell (~3s)
qwen3.5:0.8bTextWL CPUStandard (~5s)
qwen3.5:0.8b-hf1TextHF SpaceSehr langsam (~1 Tok/s, Fallback)
qwen3.5:0.8b-hf2TextHF SpaceSehr langsam (~1 Tok/s, Fallback)
qwen3.6:35bTextHetznerStandard (~5s)
kimi-k2.7:codeTextHetznerStandard (~5s)
glm-5.2TextHetznerStandard (~5s)
deepseek-v4:flashTextHetznerStandard (~5s)

WL GPU = GTX 1660 Super (Büro-PC)  ·  WL CPU = VPS Fallback

Endpunkte

API-Referenz

POST
/v1/chat/completions
OpenAI-kompatibler Chat-Endpunkt. Unterstützt stream: true für Echtzeit-Streaming.
POST
/v1/completions
Legacy Completions-Endpunkt. Wird intern in Chat-Format konvertiert.
GET
/health
Status beider Backends (GPU + CPU), Queue-Auslastung und verfügbare Modelle.
GET
/benchmark
Live-Performance-Test aller Modelle mit und ohne Thinking-Modus.
GET
/admin
Dashboard zur Verwaltung von API-Keys und Nutzungsstatistiken.
Parameter

Request-Body

ParameterTypStandardBeschreibung
modelstringModell-ID (Pflichtfeld)
messagesarrayChat-Verlauf als [{role, content}]
streambooleanfalseServer-Sent Events für Echtzeit-Ausgabe
temperaturenumber0.7Kreativität 0–2
max_tokensnumber2048Max. Ausgabe-Tokens
reasoning_effortstring"medium"*Denk-Level bei thinking-fähigen Modellen: off / low / medium / high / max
enable_thinkingbooleanan, falls Level ≠ offOb das Reasoning als reasoning_content in der Antwort mitgeschickt wird

* Nur bei Modellen mit Thinking-Fähigkeit relevant. Bei qwen3.5:4b funktioniert off normal. Bei den -hf1/-hf2-Modellen (Hugging-Face-Spaces, llama.cpp) gibt es technisch nur einen binären Schalter – jedes Level außer off aktiviert Thinking gleichermaßen, das Token-Budget wird lediglich je nach Level unterschiedlich groß gewählt.

Modell-Auswahl

Welches Modell für welchen Zweck?

qwen3.5:4b — Text + Bild

Multimodal: verarbeitet Text und Bilder. Bilder als Base64 im content-Array übergeben.

{ "model": "qwen3.5:4b", "messages": [{ "role": "user", "content": [{"type":"text","text":"Was ist auf dem Bild?"}, {"type":"image_url","image_url":{"url":"data:image/jpeg;base64,..."}}] }] }