Silnik mowy na urządzeniu

Umieść duży model AI mowy na swoim komputerze

EdgeSpeak kompresuje profesjonalne modele mowy dla desktopu i lokalnie transkrybuje spotkania, wywiady, filmy oraz nagrania. Audio, wideo i transkrypcje pozostają na urządzeniu.

  • Lokalna transkrypcja audio/wideo dostępna
  • Lokalna brama i CLI dostępne
  • Przyszłe aktualizacje modeli i głosu
Podgląd transkrypcji
Podgląd transkrypcjilocal-transcribe.mov

Dla programistów · CLI & Skills

Zainstaluj CLI jednym poleceniem

Znajoma instalacja w jednej linii, jak w narzędziach deweloperskich, których już używasz. CLI jest samodzielne, nie wymaga aplikacji desktopowej i transkrybuje bezpośrednio z terminala.

Instaluj w Terminalu na macOS lub Linux oraz w PowerShell na Windows x64. CPU działa domyślnie; Linux automatycznie wykrywa NVIDIA CUDA, a w Windows CUDA wybiera się jawnie.

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
Przeczytaj dokumentację CLI

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills, ten sam silnik

EdgeSpeak Skills uczą Claude Code, Cursora i inne agenty obsługujące Skills transkrypcji na urządzeniu przez CLI. Open source na GitHubie.

npx skills add lattifai/EdgeSpeak

Szybka transkrypcja na urządzeniu

Importuj audio lub wideo i transkrybuj lokalnie z wysoką dokładnością

Wrzuć spotkanie, wywiad lub wideo. EdgeSpeak wykonuje rozumienie mowy, generowanie transkryptu i wyrównanie tekstu na tym komputerze; narzędzia niżej w workflow odbierają tekst z lokalnej bramy.

  1. EdgeSpeak na twoim urządzeniu

    EdgeSpeak zamienia audio i wideo w tekst na komputerze przed tobą.

  2. Poprawiaj podczas słuchania

    Transkrypt podąża za odtwarzaniem, więc sprawdzanie i poprawki zostają w jednym miejscu.

  3. Wynik idzie dalej

    Eksportuj tekst lub napisy, albo pozwól innemu narzędziu pracować na gotowym transkrypcie.

Dedykowany model on-device

Lattice-2, stworzony dla desktopu

Lattice-2 jest skompresowany i zoptymalizowany do inferencji na urządzeniu, dzięki czemu zwykły komputer sprawnie przetwarza spotkania, wywiady, filmy i nagrania.

Kompresja i inferencja na urządzeniu

Model AI mowy jest ukształtowany pod działanie na desktopie, skraca oczekiwanie, a lokalna transkrypcja nie zależy od usług zewnętrznych.

Współpraca Flash / Pro

Flash szybciej reaguje w codziennych spotkaniach i transkrypcji wideo. Pro celuje w trudniejsze audio, bardziej złożone akcenty i wyższy pułap dokładności, używając więcej zasobów lokalnych.

Wbudowany w workflow deweloperskie

Lattice-2 obsługuje ponad 40 języków, różne akcenty angielskie i dialekty chińskie; ten sam lokalny silnik można udostępnić CLI, agentom i automatyzacji przez bramę.

LOCAL LM + VLM · 0.6B — 27B

Lokalny język i obraz w tym samym środowisku EdgeSpeak.

EdgeSpeak oferuje teraz modele Qwen i Gemma od 0.6B do 27B. Ładowany jest jeden model, który usypia po bezczynności.

Generowanie modelem lokalnym
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4BDomyślny4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

Tekst + obrazy · zgodność z OpenAI · lokalnie

Prawdziwa aplikacja desktopowa

EdgeSpeak działa bezpośrednio na twoim komputerze

Zaimportuj audio lub wideo, wybierz lokalny model i wyeksportuj wynik. Automatyzację przekaż przez lokalny gateway do CLI lub agentów.

Audio, wideo i transkrypt w jednym workspaceOdtwarzanie, timeline, transkrypt, eksport, ostatnie pliki i aktywny model EdgeSpeak pozostają razem, więc mniej przełączasz narzędzia i zachowujesz kontekst.
Ekran Transcribe aplikacji EdgeSpeak z workspace, stanem lokalnego modelu EdgeSpeak, transkryptem, kontrolkami odtwarzania i ostatnimi plikami.
Wybierz model EdgeSpeak do zadaniaEdgeSpeak obsługuje ponad 40 języków, różne akcenty angielskie i dialekty chińskie. Flash jest szybki i mocny; Pro dokładniejszy i używa więcej zasobów lokalnych.
Ekran Models w EdgeSpeak z lokalnymi opcjami EdgeSpeak Flash i EdgeSpeak Pro.
Pozwól innym narzędziom używać EdgeSpeakCLI, agenci i automatyzacje mogą wysłać audio do EdgeSpeak i odebrać transkrypt z EdgeSpeak.
Ekran Gateway w EdgeSpeak pokazujący, jak narzędzia na tym samym komputerze używają lokalnego silnika mowy.

Prywatność

Lokalne przetwarzanie mowy.

EdgeSpeak is designed so imported media and generated transcripts stay on your device unless you export, upload, or share them.

Kompresja i inferencja na urządzeniu

Model AI mowy jest ukształtowany pod działanie na desktopie, skraca oczekiwanie, a lokalna transkrypcja nie zależy od usług zewnętrznych.

Wynik idzie dalej

Eksportuj tekst lub napisy, albo pozwól innemu narzędziu pracować na gotowym transkrypcie.

Lokalna brama głosowa

Pozwól agentom wywoływać EdgeSpeak bezpośrednio

EdgeSpeak udostępnia lokalny API mowy zgodny z OpenAI, aby CLI, agenci i automatyzacje transkrybowały na tym samym komputerze. To nie kolejna chmura, lecz gateway mowy twojego komputera.

Lokalny endpoint zgodny z OpenAICLI / agenci / automatyzacjaEdgeSpeak Flash i Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

Choose by workflow

Local software, cloud APIs, or a model you maintain

The right option depends on where media can go, how much workflow you want ready-made, and who should maintain the speech stack.

Choose by workflowEdgeSpeakCloud transcriptionSelf-managed local model
Source mediaStays on this deviceUploaded to a remote serviceStays on the machine you configure
Review workflowDesktop playback, transcript, and exportDepends on the providerYou build the review surface
Tools and agentsLocal CLI and OpenAI-compatible gatewayHosted APIYou build and maintain the integration
OperationsInstall the app and local modelsManage an account, API keys, and network accessMaintain the runtime, models, and dependencies
Read the full comparison

Cennik

EdgeSpeak na zawsze za $49

Obecna wersja obejmuje lokalną transkrypcję audio i wideo, lokalny gateway oraz CLI. Kup raz i otrzymuj przyszłe aktualizacje modeli i funkcji mowy.

Pobierz

Zainstaluj EdgeSpeak na macOS.

Pobierz aktualny build Apple Silicon, sprawdź metadane wydania i aktywuj licencję w kilka sekund.

Current macOS build

Use the available desktop build today. Your account keeps purchase, license, and device management in one place.

Windows build

Download the Windows x64 Beta, verify its SHA-256, and follow the installation guide. This Beta uses manual updates.

License and devices

Sign in with the email used for purchase, then manage your license key and activated devices from your account.

FAQ

Frequently asked questions

On-device processing, supported platforms, models, and the lifetime license — answered before you buy.

See all questions
01Does EdgeSpeak upload source media?

Imported media and generated transcripts stay on your device unless you export, upload, or share them yourself.

02Which desktop platforms are available?

EdgeSpeak is available for Apple Silicon Macs with macOS 14.0 or later. A Windows 10/11 x64 Beta is also available for manual installation; Windows in-app updates are not enabled yet.

03What does the lifetime license include?

The early-bird lifetime license is a one-time purchase for permanent use, future model and speech-capability updates, and up to four activated devices.

04What is the difference between Flash and Pro?

Flash is tuned for faster everyday transcription. Pro raises the accuracy ceiling for harder audio and uses more local resources.

05Can CLI tools and AI agents use EdgeSpeak?

Yes. The bundled CLI and local OpenAI-compatible gateway let trusted tools on the same computer call the local speech engine.

Opinie społeczności

Ulepszaj EdgeSpeak prawdziwymi workflows

Udostępniaj prawdziwe workflows, potrzeby integracji agentów i pomysły na produkt na Discordzie.

  • Prawdziwe workflows
  • Agent / API
  • Pomysły na produkt

Twoja opinia trafia bezpośrednio do produktu.

Silnik mowy na urządzeniu

Umieść duży model AI mowy na swoim komputerze

Transcribe locally, review against an accurate timeline, then export or continue through the local gateway.

Pobierz dla macOS