Vocab Bloom Hub

Ein Wörterbuch, das neben deiner App läuft

Vocab Bloom Hub ist ein selbst gehostetes Englisch-Wörterbuch — 300 000 Einträge mit Bedeutungen, Beispielen, flektierten Formen und Übersetzungen ins Russische, Spanische, Französische, Deutsche, Portugiesische, Chinesische und Arabische — hinter einer öffentlichen, nur lesenden API, mit SDKs, einer Admin-Oberfläche und einem veröffentlichten Datensatz. Ein Befehl zur Installation, MIT für den Code, CC BY 4.0 für die Daten.

Installation mit einem Befehl

Die Compose-Datei und die Umgebungsvorlage genügen: die Images kommen aus der GitHub Container Registry, Postgres startet daneben, und das Wörterbuch lädt sich beim ersten Start selbst.

mkdir vocab-bloom-hub && cd vocab-bloom-hub
curl -fsSLO https://raw.githubusercontent.com/Fristail27/vocab-bloom-hub/main/docker-compose.yml
curl -fsSL  https://raw.githubusercontent.com/Fristail27/vocab-bloom-hub/main/.env.example -o .env
# edit .env: ADMIN_PASSWORD, POSTGRES_PASSWORD
docker compose up -d
curl -s localhost:3010/api/ready   # {"status":"ok"} once the dictionary is in

Was du bekommst

Öffentliche API

Versioniert, nur lesend, ohne Login: Suche mit Tippfehlertoleranz, Stichwörter mit Bedeutungen, Formen, Übersetzungen, Synonymen und Antonymen, Stapelabfrage, cursor-paginierte Listen, ein zufälliger Eintrag — jede Antwort in derselben Hülle, mit ETag gecacht.

SDKs

Typisierte Clients für Node.js / TypeScript und Python, aus demselben OpenAPI-Dokument generiert: eine Methode pro Endpunkt, Cursor-Iteration, typisierte Fehler, ein ETag-Cache, optionale Wiederholungen, ein DataFrame für Notebooks.

Admin-Oberfläche

Bearbeite Wörter, Bedeutungen, Übersetzungen, Synonyme und Antonyme im Browser, behalte die Statistik im Blick, importiere und exportiere das ganze Wörterbuch als Datensatz.

Datensatz

Das Wörterbuch ist auf HuggingFace unter CC BY 4.0 veröffentlicht und lädt sich selbst in eine leere Instanz; Exporte bewegen es zwischen Umgebungen, auch offline.

Gebaut für den Betrieb

Health- und Readiness-Probes, sauberes Herunterfahren, Migrationen beim Start, Prometheus-Metriken, strukturierte JSON-Logs mit Request-ID — was ein Dienst braucht, damit ihn jemand anderes betreiben kann.

Suche

Exakte, Präfix-, unscharfe und Übersetzungsstufen auf Postgres-Indizes: die häufigen Lesezugriffe antworten auf dem vollen Wörterbuch in Millisekunden.

Zwei SDKs, ein Vertrag

Beide Clients werden aus dem eingecheckten OpenAPI-Dokument der öffentlichen API generiert und laufen dem Server daher nie davon.

Node.js / TypeScript

import { VocabBloomClient } from '@vocab-bloom-hub/client';

const client = new VocabBloomClient({ baseUrl: 'https://your-instance.example/api' });

const { data } = await client.search({ search: 'runing', limit: 5 }); // typo tolerant
const run = await client.word('run'); // every part of speech, forms, meanings, translations

for await (const word of client.iterateWords({ part_of_speech: ['verb'], word_level: ['b1'] })) {
  console.log(word.word);
}

Python

from vocab_bloom_hub import VocabBloomClient

client = VocabBloomClient("https://your-instance.example/api")

hits = client.search("runing", limit=5)          # typo tolerant
run = client.word("run")                          # forms, meanings, translations

for word in client.iter_words(part_of_speech=["verb"], word_level=["b1"]):
    print(word.word)

df = client.words_dataframe(part_of_speech=["noun"])   # pip install "vocab-bloom-hub[pandas]"

Daten und Lizenz

Der Code steht unter MIT. Die Wörterbuchdaten — von der API ausgeliefert, als Datensätze exportiert, auf HuggingFace veröffentlicht — stehen unter CC BY 4.0: frei nutzbar und anpassbar, auch kommerziell, mit Namensnennung. Sie sind großteils LLM-generiert und nicht von Menschen geprüft; lies nach, was das bedeutet, bevor du dich darauf verlässt.