On-device Speech Engine

Ein Sprach-KI-Modell auf deinem Computer

EdgeSpeak komprimiert professionelle Sprachmodelle für den Desktop und transkribiert Meetings, Interviews, Videos und Aufnahmen lokal. Audio, Video und Transkripte bleiben auf deinem Gerät.

  • Lokale Audio-/Videotranskription verfügbar
  • Lokales Gateway und CLI verfügbar
  • Künftige Modell- und Speech-Updates
Transkript-Vorschau
Transkript-Vorschaulocal-transcribe.mov

Für Entwickler · CLI & Skills

CLI mit einem Befehl installieren

Der vertraute Einzeiler, den du von deinen Entwicklertools kennst. Das CLI ist eigenständig, braucht keine Desktop-App und transkribiert direkt im Terminal.

Installation unter macOS und Linux im Terminal, unter Windows x64 in PowerShell. CPU funktioniert sofort; Linux erkennt NVIDIA CUDA automatisch, unter Windows ist CUDA optional auswählbar.

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
CLI-Dokumentation lesen

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills, dieselbe Engine

EdgeSpeak Skills bringen Claude Code, Cursor und anderen Skills-fähigen Agents bei, über das CLI direkt auf dem Gerät zu transkribieren. Open Source auf GitHub.

npx skills add lattifai/EdgeSpeak

Schnelle On-device-Transkription

Audio oder Video importieren und lokal hochpräzise transkribieren

Ziehe ein Meeting, Interview oder Video hinein. EdgeSpeak übernimmt Sprachverstehen, Transkripterzeugung und Textausrichtung auf diesem Computer; nachgelagerte Tools holen das Transkript über das lokale Gateway ab.

  1. EdgeSpeak auf deinem Gerät

    EdgeSpeak macht Audio und Video auf deinem Computer zu Text.

  2. Beim Hören korrigieren

    Das Transkript folgt der Wiedergabe, damit Korrekturen in einem Arbeitsbereich bleiben.

  3. Ergebnisse weiterverwenden

    Exportiere Text oder Untertitel, oder lass ein anderes Tool mit dem fertigen Transkript weiterarbeiten.

Dediziertes On-device-Modell

Lattice-2, für den Desktop gemacht

Lattice-2 ist komprimiert und für On-Device-Inferenz optimiert, damit ein normaler Computer Meetings, Interviews, Videos und Aufnahmen effizient verarbeitet.

On-device-Kompression und Inferenzanpassung

Das Sprach-KI-Modell wird für Desktop-Ausführung geformt, reduziert Wartezeit und lokale Transkription hängt nicht von externen Diensten ab.

Flash / Pro im Zusammenspiel

Flash ist für alltägliche Meetings und Videotranskription schnell. Pro zielt auf schwierigere Audios, komplexere Akzente und höhere Genauigkeit, nutzt dabei mehr lokale Ressourcen.

In Entwickler-Workflows integrierbar

Lattice-2 unterstützt über 40 Sprachen, mehrere englische Akzente und chinesische Dialekte; dieselbe lokale Engine steht CLI, Agents und Automatisierung über das Gateway bereit.

LOCAL LM + VLM · 0.6B — 27B

Lokale Sprache und Bildverstehen in derselben EdgeSpeak-Laufzeit.

EdgeSpeak bietet jetzt Qwen- und Gemma-Modelle von 0.6B bis 27B. Es wird jeweils ein Modell geladen und bei Leerlauf pausiert.

Mit einem lokalen Modell generieren
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4BStandard4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

Text + Bilder · OpenAI-kompatibel · lokal zuerst

Echte Desktop-App

EdgeSpeak läuft direkt auf deinem Computer

Importiere Audio oder Video, wähle ein lokales Modell und exportiere das Ergebnis. Für Automatisierung übergibst du Aufgaben über das lokale Gateway an CLI oder Agents.

Audio, Video und Transkript in einem WorkspaceWiedergabe, Timeline, Transkript, Export, letzte Dateien und aktives EdgeSpeak-Modell bleiben zusammen, damit du weniger zwischen Tools wechselst und Kontext behältst.
EdgeSpeak Desktop-Transkriptionsansicht mit Workspace, lokalem EdgeSpeak-Modellstatus, Transkript, Wiedergabesteuerung und letzten Dateien.
Das passende EdgeSpeak-Modell für die AufgabeEdgeSpeak unterstützt über 40 Sprachen, mehrere englische Akzente und chinesische Dialekte. Flash ist schnell und stark; Pro ist genauer und nutzt mehr lokale Ressourcen.
EdgeSpeak Desktop-Modellseite mit lokalen Optionen EdgeSpeak Flash und EdgeSpeak Pro.
Andere Tools können EdgeSpeak nutzenCLI-Tools, Agents und Automatisierung senden Audio an EdgeSpeak und erhalten das Transkript von EdgeSpeak zurück.
EdgeSpeak Desktop-Gatewayseite, die zeigt, wie Tools auf demselben Computer die lokale Speech Engine nutzen.

Datenschutz

Lokale Sprachverarbeitung zuerst.

EdgeSpeak is designed so imported media and generated transcripts stay on your device unless you export, upload, or share them.

On-device-Kompression und Inferenzanpassung

Das Sprach-KI-Modell wird für Desktop-Ausführung geformt, reduziert Wartezeit und lokale Transkription hängt nicht von externen Diensten ab.

Ergebnisse weiterverwenden

Exportiere Text oder Untertitel, oder lass ein anderes Tool mit dem fertigen Transkript weiterarbeiten.

Lokales Speech Gateway

Lass Agents EdgeSpeak direkt aufrufen

EdgeSpeak bietet eine lokale, OpenAI-kompatible Sprach-API. CLI, Agents und Automatisierungen transkribieren auf demselben Computer. Keine weitere Cloud, sondern das Sprach-Gateway deines Computers.

Lokaler OpenAI-kompatibler EndpunktCLI / Agents / AutomatisierungEdgeSpeak Flash und Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

Choose by workflow

Local software, cloud APIs, or a model you maintain

The right option depends on where media can go, how much workflow you want ready-made, and who should maintain the speech stack.

Choose by workflowEdgeSpeakCloud transcriptionSelf-managed local model
Source mediaStays on this deviceUploaded to a remote serviceStays on the machine you configure
Review workflowDesktop playback, transcript, and exportDepends on the providerYou build the review surface
Tools and agentsLocal CLI and OpenAI-compatible gatewayHosted APIYou build and maintain the integration
OperationsInstall the app and local modelsManage an account, API keys, and network accessMaintain the runtime, models, and dependencies
Read the full comparison

Preise

EdgeSpeak lebenslang für $49

Die aktuelle Version umfasst lokale Audio- und Videotranskription, das lokale Gateway und CLI. Einmal kaufen und künftige Modell- und Sprachfunktionsupdates erhalten.

Download

EdgeSpeak auf macOS installieren.

Lade den aktuellen Apple-Silicon-Build, prüfe die Release-Metadaten und aktiviere deine license in Sekunden.

Current macOS build

Use the available desktop build today. Your account keeps purchase, license, and device management in one place.

Windows build

Download the Windows x64 Beta, verify its SHA-256, and follow the installation guide. This Beta uses manual updates.

License and devices

Sign in with the email used for purchase, then manage your license key and activated devices from your account.

FAQ

Frequently asked questions

On-device processing, supported platforms, models, and the lifetime license — answered before you buy.

See all questions
01Does EdgeSpeak upload source media?

Imported media and generated transcripts stay on your device unless you export, upload, or share them yourself.

02Which desktop platforms are available?

EdgeSpeak is available for Apple Silicon Macs with macOS 14.0 or later. A Windows 10/11 x64 Beta is also available for manual installation; Windows in-app updates are not enabled yet.

03What does the lifetime license include?

The early-bird lifetime license is a one-time purchase for permanent use, future model and speech-capability updates, and up to four activated devices.

04What is the difference between Flash and Pro?

Flash is tuned for faster everyday transcription. Pro raises the accuracy ceiling for harder audio and uses more local resources.

05Can CLI tools and AI agents use EdgeSpeak?

Yes. The bundled CLI and local OpenAI-compatible gateway let trusted tools on the same computer call the local speech engine.

Community-Feedback

Verbessere EdgeSpeak mit echten Workflows

Teile reale Workflows, Anforderungen an Agent-Integrationen und Produktideen auf Discord.

  • Echte Workflows
  • Agent / API
  • Produktideen

Dein Feedback fließt direkt in das Produkt ein.

On-device Speech Engine

Ein Sprach-KI-Modell auf deinem Computer

Transcribe locally, review against an accurate timeline, then export or continue through the local gateway.

Für macOS herunterladen