Motor de voz no dispositivo

Coloque um grande modelo de IA de voz no seu computador

O EdgeSpeak comprime modelos de voz profissionais para o desktop e transcreve localmente reuniões, entrevistas, vídeos e gravações. Áudio, vídeo e transcrições permanecem no seu dispositivo.

  • Transcrição local de áudio/vídeo disponível
  • Gateway local e CLI disponíveis
  • Futuras atualizações de modelo e voz
Pré-visualização da transcrição
Pré-visualização da transcriçãolocal-transcribe.mov

Desenvolvedores · CLI & Skills

Instale a CLI com um único comando

A instalação de uma linha que você já conhece das suas ferramentas de desenvolvimento. A CLI é autossuficiente, dispensa o app de desktop e transcreve direto do terminal.

Instale pelo Terminal no macOS ou Linux e pelo PowerShell no Windows x64. A CPU funciona de imediato; o Linux detecta NVIDIA CUDA automaticamente e, no Windows, CUDA é uma opção explícita.

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
Ler a documentação da CLI

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills, o mesmo motor

As EdgeSpeak Skills ensinam o Claude Code, o Cursor e outros agentes compatíveis com Skills a transcrever no dispositivo pela CLI. Código aberto no GitHub.

npx skills add lattifai/EdgeSpeak

Transcrição rápida no dispositivo

Importe áudio ou vídeo e transcreva localmente com alta precisão

Arraste uma reunião, entrevista ou vídeo. O EdgeSpeak faz compreensão de fala, geração de transcrição e alinhamento de texto neste computador; quando ferramentas seguintes precisarem continuar, pegam o texto pelo gateway local.

  1. EdgeSpeak no seu dispositivo

    EdgeSpeak transforma áudio e vídeo em texto no computador à sua frente.

  2. Corrija enquanto ouve

    A transcrição acompanha a reprodução, para rever e corrigir no mesmo lugar.

  3. O resultado continua

    Exporte texto ou legendas, ou deixe outra ferramenta continuar a partir da transcrição pronta.

Modelo dedicado no dispositivo

Lattice-2, feito para o desktop

O Lattice-2 é comprimido e otimizado para inferência no dispositivo, para que um computador comum processe reuniões, entrevistas, vídeos e gravações com eficiência.

Compressão e inferência no dispositivo

O modelo de IA de voz é ajustado para execução no desktop, reduzindo espera; a transcrição local não depende de serviços externos.

Coordenação Flash / Pro

Flash responde mais rápido para reuniões e vídeos do dia a dia. Pro mira áudio mais difícil, sotaques mais complexos e maior teto de precisão, usando mais recursos locais.

Integrado a workflows de desenvolvimento

Lattice-2 suporta mais de 40 idiomas, vários sotaques de inglês e dialetos chineses; o mesmo motor local pode servir CLI, agentes e automação pelo gateway.

LOCAL LM + VLM · 0.6B — 27B

Linguagem e visão locais no mesmo runtime EdgeSpeak.

O EdgeSpeak agora inclui modelos Qwen e Gemma de 0.6B a 27B. Um modelo é carregado por vez e entra em repouso quando ocioso.

Gerar com um modelo local
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4BPadrão4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

Texto + imagens · compatível com OpenAI · local primeiro

App desktop real

EdgeSpeak roda direto no seu computador

Importe áudio ou vídeo, escolha um modelo local e exporte o resultado. Para automatizar, passe o trabalho para CLI ou agentes pelo gateway local.

Áudio, vídeo e transcrição em um só workspaceReprodução, timeline, transcrição, exportação, ficheiros recentes e modelo EdgeSpeak ativo ficam juntos, reduzindo trocas de ferramenta e perda de contexto.
Tela de transcrição do EdgeSpeak desktop com workspace, estado do modelo EdgeSpeak local, texto, controles de reprodução e ficheiros recentes.
Escolha o modelo EdgeSpeak certo para a tarefaEdgeSpeak suporta mais de 40 idiomas, vários sotaques de inglês e dialetos chineses. Flash é rápido e forte; Pro é mais preciso e usa mais recursos locais.
Tela de modelos do EdgeSpeak com opções locais EdgeSpeak Flash e EdgeSpeak Pro.
Deixe outras ferramentas usarem EdgeSpeakCLI, agentes e automações podem enviar áudio ao EdgeSpeak e receber a transcrição de volta do EdgeSpeak.
Tela de gateway do EdgeSpeak mostrando como ferramentas no mesmo computador usam o motor de voz local.

Privacidade

Processamento de voz local-first.

EdgeSpeak is designed so imported media and generated transcripts stay on your device unless you export, upload, or share them.

Compressão e inferência no dispositivo

O modelo de IA de voz é ajustado para execução no desktop, reduzindo espera; a transcrição local não depende de serviços externos.

O resultado continua

Exporte texto ou legendas, ou deixe outra ferramenta continuar a partir da transcrição pronta.

Gateway de voz local

Deixe agentes chamarem o EdgeSpeak diretamente

O EdgeSpeak oferece uma API de voz local compatível com OpenAI para CLI, agentes e automações transcreverem no mesmo computador. Não é outra nuvem: é o gateway de voz do seu computador.

Endpoint local compatível com OpenAICLI / agentes / automaçãoEdgeSpeak Flash e Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

Choose by workflow

Local software, cloud APIs, or a model you maintain

The right option depends on where media can go, how much workflow you want ready-made, and who should maintain the speech stack.

Choose by workflowEdgeSpeakCloud transcriptionSelf-managed local model
Source mediaStays on this deviceUploaded to a remote serviceStays on the machine you configure
Review workflowDesktop playback, transcript, and exportDepends on the providerYou build the review surface
Tools and agentsLocal CLI and OpenAI-compatible gatewayHosted APIYou build and maintain the integration
OperationsInstall the app and local modelsManage an account, API keys, and network accessMaintain the runtime, models, and dependencies
Read the full comparison

Preços

EdgeSpeak para sempre por $49

A versão atual inclui transcrição local de áudio e vídeo, gateway local e CLI. Compre uma vez e receba futuras atualizações de modelos e recursos de voz.

Download

Instale o EdgeSpeak no macOS.

Obtenha o build Apple Silicon atual, verifique os metadados da versão e ative a licença em segundos.

Current macOS build

Use the available desktop build today. Your account keeps purchase, license, and device management in one place.

Windows build

Download the Windows x64 Beta, verify its SHA-256, and follow the installation guide. This Beta uses manual updates.

License and devices

Sign in with the email used for purchase, then manage your license key and activated devices from your account.

FAQ

Frequently asked questions

On-device processing, supported platforms, models, and the lifetime license — answered before you buy.

See all questions
01Does EdgeSpeak upload source media?

Imported media and generated transcripts stay on your device unless you export, upload, or share them yourself.

02Which desktop platforms are available?

EdgeSpeak is available for Apple Silicon Macs with macOS 14.0 or later. A Windows 10/11 x64 Beta is also available for manual installation; Windows in-app updates are not enabled yet.

03What does the lifetime license include?

The early-bird lifetime license is a one-time purchase for permanent use, future model and speech-capability updates, and up to four activated devices.

04What is the difference between Flash and Pro?

Flash is tuned for faster everyday transcription. Pro raises the accuracy ceiling for harder audio and uses more local resources.

05Can CLI tools and AI agents use EdgeSpeak?

Yes. The bundled CLI and local OpenAI-compatible gateway let trusted tools on the same computer call the local speech engine.

Feedback da comunidade

Melhore o EdgeSpeak com workflows reais

Compartilhe workflows reais, necessidades de integração com agentes e ideias de produto no Discord.

  • Workflows reais
  • Agent / API
  • Ideias de produto

Motor de voz no dispositivo

Coloque um grande modelo de IA de voz no seu computador

Transcribe locally, review against an accurate timeline, then export or continue through the local gateway.

Download para macOS