Moteur vocal sur appareil

Mettez un grand modèle d’IA vocale dans votre ordinateur

EdgeSpeak compresse des modèles vocaux professionnels pour le bureau et transcrit localement réunions, entretiens, vidéos et enregistrements. Audio, vidéo et transcriptions restent sur votre appareil.

  • Transcription locale audio/vidéo disponible
  • Passerelle locale et CLI disponibles
  • Futures mises à jour modèle et voix
Aperçu de transcription
Aperçu de transcriptionlocal-transcribe.mov

Développeurs · CLI & Skills

Installez la CLI en une seule commande

L'installation en une ligne que vous connaissez déjà avec vos outils de développement. La CLI est autonome, ne requiert aucune app de bureau et transcrit directement depuis le terminal.

Installez-la depuis Terminal sur macOS ou Linux, et depuis PowerShell sur Windows x64. Le CPU fonctionne immédiatement ; Linux détecte NVIDIA CUDA automatiquement, tandis que CUDA reste optionnel sous Windows.

macOS · Apple SiliconWindows x64 · CPU / CUDALinux x86_64 · CPU / CUDA
Lire la documentation CLI

macOS / Linux · Terminal

curl -fsSL https://edgespeak.com/install.sh | sh

Windows · PowerShell

irm https://edgespeak.com/install.ps1 | iex
edgespeak-cli login
edgespeak-cli transcribe media.mp4 -o media.srt
edgespeak-cli generate "Summarize this transcript" --model Qwen/Qwen3.5-4B

Agent Skills, le même moteur

Les EdgeSpeak Skills apprennent à Claude Code, Cursor et aux autres agents compatibles Skills à transcrire sur l'appareil via la CLI. Open source sur GitHub.

npx skills add lattifai/EdgeSpeak

Transcription rapide sur l’appareil

Importez audio ou vidéo et transcrivez localement avec précision

Déposez une réunion, une interview ou une vidéo. EdgeSpeak réalise la compréhension vocale, la génération de transcription et l’alignement du texte sur cet ordinateur ; les outils en aval récupèrent ensuite le texte via la passerelle locale.

  1. EdgeSpeak sur votre appareil

    EdgeSpeak transforme l’audio et la vidéo en texte sur l’ordinateur devant vous.

  2. Corriger en écoutant

    La transcription suit la lecture, pour corriger dans le même espace de travail.

  3. Le résultat continue

    Exportez le texte ou les sous-titres, ou laissez un autre outil repartir de la transcription terminée.

Modèle dédié sur l’appareil

Lattice-2, conçu pour le bureau

Lattice-2 est compressé et optimisé pour l’inférence sur l’appareil, afin qu’un ordinateur courant traite efficacement réunions, entretiens, vidéos et enregistrements.

Compression et inférence sur l’appareil

Le modèle d’IA vocale est adapté à l’exécution desktop, réduit l’attente, et la transcription locale ne dépend pas de services externes.

Coordination Flash / Pro

Flash répond vite pour les réunions et vidéos du quotidien. Pro vise les audios plus difficiles, les accents plus complexes et un plafond de précision plus élevé, avec davantage de ressources locales.

Intégré aux workflows développeur

Lattice-2 prend en charge plus de 40 langues, plusieurs accents anglais et des dialectes chinois ; le même moteur local peut servir CLI, agents et automatisations via la passerelle.

LOCAL LM + VLM · 0.6B — 27B

Langage et vision en local, dans le même moteur EdgeSpeak.

EdgeSpeak propose désormais des modèles Qwen et Gemma de 0.6B à 27B. Un seul modèle est chargé et se met en veille au repos.

Générer avec un modèle local
Qwen/Qwen3-0.6B0.6B0.4 GB
Qwen/Qwen3.5-0.8B0.8B0.5 GB
Qwen/Qwen3.5-2B2B1.3 GB
google/gemma-4-E2B-it2B3.1 GB
Qwen/Qwen3.5-4BPar défaut4B2.7 GB
google/gemma-4-E4B-it4B5.0 GB
Qwen/Qwen3.5-9B9B5.7 GB
google/gemma-4-12B-it12B7.1 GB
Qwen/Qwen3.6-27B27B16.8 GB

Texte + images · compatible OpenAI · local d’abord

Vraie app desktop

EdgeSpeak fonctionne directement sur votre ordinateur

Importez un audio ou une vidéo, choisissez un modèle local et exportez le résultat. Pour automatiser, transmettez le travail au CLI ou aux agents via la passerelle locale.

Audio, vidéo et transcription dans un seul espaceLecture, timeline, transcription, export, fichiers récents et modèle EdgeSpeak actif restent ensemble, pour changer moins d’outil et garder le contexte.
Écran de transcription EdgeSpeak montrant l’espace de travail, l’état du modèle EdgeSpeak local, la transcription, les contrôles de lecture et les fichiers récents.
Choisissez le bon modèle EdgeSpeakEdgeSpeak prend en charge plus de 40 langues, plusieurs accents anglais et des dialectes chinois. Flash est rapide et solide ; Pro est plus précis et utilise plus de ressources locales.
Écran Modèles d’EdgeSpeak avec les options locales EdgeSpeak Flash et EdgeSpeak Pro.
Laissez d’autres outils utiliser EdgeSpeakCLI, agents et automatisations peuvent envoyer l’audio à EdgeSpeak et récupérer la transcription depuis EdgeSpeak.
Écran Gateway d’EdgeSpeak montrant comment les outils du même ordinateur utilisent le moteur vocal local.

Confidentialité

Traitement vocal local d'abord.

EdgeSpeak is designed so imported media and generated transcripts stay on your device unless you export, upload, or share them.

Compression et inférence sur l’appareil

Le modèle d’IA vocale est adapté à l’exécution desktop, réduit l’attente, et la transcription locale ne dépend pas de services externes.

Le résultat continue

Exportez le texte ou les sous-titres, ou laissez un autre outil repartir de la transcription terminée.

Passerelle vocale locale

Laissez les agents appeler EdgeSpeak directement

EdgeSpeak fournit une API vocale locale compatible OpenAI, afin que CLI, agents et automatisations transcrivent sur le même ordinateur. Ce n’est pas un cloud de plus, mais la passerelle vocale de votre ordinateur.

Endpoint local compatible OpenAICLI / agents / automatisationEdgeSpeak Flash et Pro
POST /v1/audio/transcriptionslocalhost:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F file=@meeting.m4a \
  -F model="lattice-2-flash"

Choose by workflow

Local software, cloud APIs, or a model you maintain

The right option depends on where media can go, how much workflow you want ready-made, and who should maintain the speech stack.

Choose by workflowEdgeSpeakCloud transcriptionSelf-managed local model
Source mediaStays on this deviceUploaded to a remote serviceStays on the machine you configure
Review workflowDesktop playback, transcript, and exportDepends on the providerYou build the review surface
Tools and agentsLocal CLI and OpenAI-compatible gatewayHosted APIYou build and maintain the integration
OperationsInstall the app and local modelsManage an account, API keys, and network accessMaintain the runtime, models, and dependencies
Read the full comparison

Tarifs

EdgeSpeak à vie pour $49

La version actuelle inclut la transcription audio et vidéo locale, la passerelle locale et le CLI. Achetez une fois et recevez les futures mises à jour des modèles et fonctions vocales.

Télécharger

Installez EdgeSpeak sur macOS.

Téléchargez le build Apple Silicon actuel, vérifiez les métadonnées de version et activez votre licence en quelques secondes.

Current macOS build

Use the available desktop build today. Your account keeps purchase, license, and device management in one place.

Windows build

Download the Windows x64 Beta, verify its SHA-256, and follow the installation guide. This Beta uses manual updates.

License and devices

Sign in with the email used for purchase, then manage your license key and activated devices from your account.

FAQ

Frequently asked questions

On-device processing, supported platforms, models, and the lifetime license — answered before you buy.

See all questions
01Does EdgeSpeak upload source media?

Imported media and generated transcripts stay on your device unless you export, upload, or share them yourself.

02Which desktop platforms are available?

EdgeSpeak is available for Apple Silicon Macs with macOS 14.0 or later. A Windows 10/11 x64 Beta is also available for manual installation; Windows in-app updates are not enabled yet.

03What does the lifetime license include?

The early-bird lifetime license is a one-time purchase for permanent use, future model and speech-capability updates, and up to four activated devices.

04What is the difference between Flash and Pro?

Flash is tuned for faster everyday transcription. Pro raises the accuracy ceiling for harder audio and uses more local resources.

05Can CLI tools and AI agents use EdgeSpeak?

Yes. The bundled CLI and local OpenAI-compatible gateway let trusted tools on the same computer call the local speech engine.

Avis de la communauté

Améliorez EdgeSpeak avec de vrais workflows

Partagez vos workflows, vos besoins d’intégration d’agents et vos idées produit sur Discord.

  • Workflows réels
  • Agent / API
  • Idées produit

Vos retours alimentent directement le produit.

Moteur vocal sur appareil

Mettez un grand modèle d’IA vocale dans votre ordinateur

Transcribe locally, review against an accurate timeline, then export or continue through the local gateway.

Télécharger pour macOS