Mesin suara di perangkat

Masukkan model AI suara besar ke komputer Anda

EdgeSpeak memampatkan model suara profesional untuk desktop dan mentranskripsikan rapat, wawancara, video, serta rekaman secara lokal. Audio, video, dan transkrip tetap di perangkat Anda.

  • Transkripsi audio/video lokal tersedia
  • Gateway lokal dan CLI tersedia
  • Pembaruan model dan kemampuan suara berikutnya
Preview transkrip
Preview transkriplocal-transcribe.mov

Pengembang · CLI & Skills

Instal CLI dengan satu perintah

Instalasi satu baris yang sudah akrab, seperti alat pengembang yang Anda pakai sehari-hari. CLI berdiri sendiri, tanpa aplikasi desktop, dan mentranskripsi langsung dari terminal.

Instal melalui Terminal di macOS atau Linux, dan PowerShell di Windows x64. CPU langsung berfungsi; Linux mendeteksi NVIDIA CUDA secara otomatis, sedangkan CUDA di Windows dipilih secara eksplisit.

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
Baca dokumentasi CLI

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills, mesin yang sama

EdgeSpeak Skills mengajari Claude Code, Cursor, dan agen lain yang mendukung Skills untuk mentranskripsi di perangkat melalui CLI. Sumber terbuka di GitHub.

npx skills add lattifai/EdgeSpeak

Transkripsi cepat di perangkat

Impor audio atau video dan transkripsikan secara lokal dengan akurasi tinggi

Masukkan rapat, wawancara, atau video. EdgeSpeak menjalankan pemahaman suara, pembuatan transkrip, dan penyelarasan teks di komputer ini; ketika alat berikutnya perlu melanjutkan, mereka mengambil transkrip dari gateway lokal.

  1. EdgeSpeak di perangkat Anda

    EdgeSpeak mengubah audio dan video menjadi teks di komputer di depan Anda.

  2. Koreksi sambil mendengar

    Transkrip mengikuti pemutaran, jadi pemeriksaan dan koreksi tetap di satu ruang kerja.

  3. Hasil terus bergerak

    Ekspor teks atau subtitle, atau biarkan alat lain melanjutkan dari transkrip yang sudah jadi.

Model khusus di perangkat

Lattice-2, dibuat untuk desktop

Lattice-2 dimampatkan dan dioptimalkan untuk inferensi di perangkat, sehingga komputer biasa dapat memproses rapat, wawancara, video, dan rekaman secara efisien.

Kompresi dan inferensi di perangkat

Model AI suara dibentuk agar cocok berjalan di desktop, mengurangi waktu tunggu, dan transkripsi lokal tidak bergantung pada layanan eksternal.

Kolaborasi Flash / Pro

Flash merespons lebih cepat untuk rapat dan video sehari-hari. Pro menargetkan audio lebih sulit, aksen lebih kompleks, dan batas akurasi lebih tinggi, dengan lebih banyak sumber daya lokal.

Masuk ke alur kerja developer

Lattice-2 mendukung 40+ bahasa, banyak aksen Inggris, dan dialek Tionghoa; mesin lokal yang sama bisa diberikan ke CLI, agent, dan otomasi melalui gateway.

LOCAL LM + VLM · 0.6B — 27B

Bahasa dan visi lokal dalam runtime EdgeSpeak yang sama.

EdgeSpeak kini menyediakan model Qwen dan Gemma dari 0.6B hingga 27B. Satu model dimuat pada satu waktu dan tidur saat menganggur.

Buat dengan model lokal
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4BBawaan4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

Teks + gambar · kompatibel OpenAI · lokal lebih dulu

Aplikasi desktop nyata

EdgeSpeak berjalan langsung di komputer Anda

Impor audio atau video, pilih model lokal, lalu ekspor hasilnya. Untuk otomasi, teruskan pekerjaan ke CLI atau agent melalui gateway lokal.

Audio, video, dan transkrip dalam satu workspacePemutaran, timeline, transkrip, ekspor, file terbaru, dan model EdgeSpeak aktif tetap bersama, sehingga lebih sedikit berpindah alat dan konteks tetap terjaga.
Layar Transcribe desktop EdgeSpeak yang menampilkan workspace, status model EdgeSpeak lokal, isi transkrip, kontrol pemutaran, dan file terbaru.
Pilih model EdgeSpeak sesuai tugasEdgeSpeak mendukung 40+ bahasa, banyak aksen Inggris, dan dialek Tionghoa. Flash cepat dan kuat; Pro lebih akurat dan memakai lebih banyak sumber daya lokal.
Layar Models desktop EdgeSpeak yang menampilkan opsi lokal EdgeSpeak Flash dan EdgeSpeak Pro.
Biarkan alat lain memakai EdgeSpeakCLI, agent, dan otomasi dapat mengirim audio ke EdgeSpeak dan menerima transkrip kembali dari EdgeSpeak.
Layar Gateway desktop EdgeSpeak yang menunjukkan alat di komputer yang sama memakai mesin suara lokal.

Privasi

Pemrosesan suara local-first.

EdgeSpeak is designed so imported media and generated transcripts stay on your device unless you export, upload, or share them.

Kompresi dan inferensi di perangkat

Model AI suara dibentuk agar cocok berjalan di desktop, mengurangi waktu tunggu, dan transkripsi lokal tidak bergantung pada layanan eksternal.

Hasil terus bergerak

Ekspor teks atau subtitle, atau biarkan alat lain melanjutkan dari transkrip yang sudah jadi.

Gateway suara lokal

Biarkan agent memanggil EdgeSpeak langsung

EdgeSpeak menyediakan API suara lokal yang kompatibel dengan OpenAI, sehingga CLI, agent, dan otomasi dapat mentranskripsi di komputer yang sama. Bukan cloud lain, melainkan gateway suara komputer Anda.

Endpoint lokal kompatibel OpenAICLI / agent / otomasiEdgeSpeak Flash dan Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

Choose by workflow

Local software, cloud APIs, or a model you maintain

The right option depends on where media can go, how much workflow you want ready-made, and who should maintain the speech stack.

Choose by workflowEdgeSpeakCloud transcriptionSelf-managed local model
Source mediaStays on this deviceUploaded to a remote serviceStays on the machine you configure
Review workflowDesktop playback, transcript, and exportDepends on the providerYou build the review surface
Tools and agentsLocal CLI and OpenAI-compatible gatewayHosted APIYou build and maintain the integration
OperationsInstall the app and local modelsManage an account, API keys, and network accessMaintain the runtime, models, and dependencies
Read the full comparison

Early bird

EdgeSpeak selamanya seharga $49

Versi saat ini mencakup transkripsi audio dan video lokal, gateway lokal, serta CLI. Beli sekali dan terus dapatkan pembaruan model dan kemampuan suara.

Unduh

Instal EdgeSpeak di macOS.

Choose the current macOS build or open the Windows Beta page for the x64 installer and verified setup instructions.

Current macOS build

Use the available desktop build today. Your account keeps purchase, license, and device management in one place.

Windows build

Download the Windows x64 Beta, verify its SHA-256, and follow the installation guide. This Beta uses manual updates.

License and devices

Sign in with the email used for purchase, then manage your license key and activated devices from your account.

FAQ

Frequently asked questions

On-device processing, supported platforms, models, and the lifetime license — answered before you buy.

See all questions
01Does EdgeSpeak upload source media?

Imported media and generated transcripts stay on your device unless you export, upload, or share them yourself.

02Which desktop platforms are available?

EdgeSpeak is available for Apple Silicon Macs with macOS 14.0 or later. A Windows 10/11 x64 Beta is also available for manual installation; Windows in-app updates are not enabled yet.

03What does the lifetime license include?

The early-bird lifetime license is a one-time purchase for permanent use, future model and speech-capability updates, and up to four activated devices.

04What is the difference between Flash and Pro?

Flash is tuned for faster everyday transcription. Pro raises the accuracy ceiling for harder audio and uses more local resources.

05Can CLI tools and AI agents use EdgeSpeak?

Yes. The bundled CLI and local OpenAI-compatible gateway let trusted tools on the same computer call the local speech engine.

Masukan komunitas

Tingkatkan EdgeSpeak dengan workflow nyata

Bagikan workflow nyata, kebutuhan integrasi agent, dan ide produk di Discord.

  • Workflow nyata
  • Agent / API
  • Ide produk

Masukan Anda langsung masuk ke pengembangan produk.

Mesin suara di perangkat

Masukkan model AI suara besar ke komputer Anda

Transcribe locally, review against an accurate timeline, then export or continue through the local gateway.

Unduh untuk macOS