fullstackchris.dev
Proyectos / Keevo
CASO DE ESTUDIO · HERRAMIENTA DE DESARROLLO

Keevo

Keevo es una herramienta de escritorio de transcripción y subtitulado construida para creadores de contenido y productores de vídeo. Procesa el vídeo localmente usando un modelo de reconocimiento de voz en el dispositivo, genera transcripciones con marcas de tiempo, y exporta archivos de subtítulos en múltiples formatos — sin subidas a la nube, sin costes de API, sin preocupaciones de privacidad.

TauriRustReactTypeScriptOn-device AI
Rol
Solo · full-stack
Duración
2025 · en curso
Plataforma
Escritorio · macOS · Windows
Tipo
Herramienta de desarrollo
keevo.app
Keevo screenshot
EL PROBLEMA

Los creadores de contenido pasan horas transcribiendo manualmente el metraje o pagan costes recurrentes de API a servicios de voz en la nube.

Construido para editores de vídeo freelance, podcasters y equipos de contenido que procesan grabaciones sensibles y quieren la propiedad total de su flujo de trabajo sin costes de suscripción.

  • La transcripción en la nube es cara. Los costes de API se acumulan rápido en grabaciones largas y erosionan los márgenes freelance.
  • La privacidad es una preocupación real. Subir metraje de clientes a servidores de terceros es inaceptable para muchos profesionales del vídeo.
  • La transcripción manual es brutal. Horas de escuchar y escribir que no aportan nada creativo a la producción.

Creadores de vídeo y podcasters

Editores freelance, equipos de contenido y podcasters que necesitan transcripción rápida y privada sin costes de API recurrentes

0 nube
dependencia
<4 min
por hora de metraje
100%
local y privado
LA SOLUCIÓN

tu metraje nunca sale de tu máquina.

Shell de Tauri (núcleo Rust) con un renderizador React en la webview del sistema. El modelo de voz corre en un worker Rust lanzado desde el backend de Tauri, con resultados transmitidos al renderizador vía IPC a medida que se completan los segmentos. SQLite almacena el estado del proyecto localmente.

01

Importar

Suelta cualquier archivo de vídeo o audio.

02

Transcribir

El modelo en el dispositivo se ejecuta, los segmentos se transmiten.

03

Editar

Corrige palabras y ajusta marcas de tiempo en la línea de tiempo.

04

Exportar

SRT, VTT o texto plano — listo para cualquier editor.

Antes
flujo de trabajo manual
herramientas fragmentadas · alta carga manual
Después
keevo.app
producto único unificado · rápido y automatizado
FUNCIONALIDADES CLAVE

Construido en torno a cómo trabaja realmente creadores de vídeo y podcasters.

FEATURE 01

Inferencia en el dispositivo

Un modelo de voz cuantizado corre enteramente en la máquina local en un worker Rust lanzado por el backend de Tauri — sin claves de API, sin subidas, sin costes recurrentes.

  • El runtime de inferencia Rust nativo funciona en macOS y Windows
  • Los resultados se transmiten a la UI a medida que se completan los segmentos
inferencia-en
Inferencia en el dispositivo
FEATURE 02

Editor de línea de tiempo

Corrige la salida del modelo en un editor de transcripción sincronizado — hacer clic en cualquier palabra busca el vídeo, así que la revisión es rápida.

  • Visualización de marcas de tiempo a nivel de palabra
  • Flujo de edición orientado al teclado
editor-de
Editor de línea de tiempo
FEATURE 03

Exportación multi-formato

Exporta a SRT, WebVTT o texto plano con un clic — listo para importar en Premiere, Final Cut, DaVinci o cualquier herramienta de subtítulos.

  • Códigos de tiempo precisos de la pasada de reconciliación
  • Compatible con UTF-8 para contenido multilingüe
exportación-multi-formato
captura · Exportación multi-formato
DESAFÍO TÉCNICO

Problemas difíciles resueltos.

El pipeline extrae el audio vía ffmpeg, lo divide en segmentos solapados, ejecuta la inferencia en un pool de workers, fusiona los resultados con una pasada de reconciliación de marcas de tiempo, y luego los muestra en el editor. La exportación de subtítulos soporta SRT, VTT y texto plano.

Qué lo hizo difícil

  • Ejecutar un modelo de voz cuantizado en el dispositivo dentro de Tauri sin bloquear el hilo de la interfaz.
  • Gestionar la segmentación de audio de larga duración para producir marcas de tiempo precisas a través de ritmos de habla variables.
  • Diseñar un editor de línea de tiempo que permita a los usuarios corregir transcripciones sin volver a ejecutar el modelo.
  • Empaquetar binarios nativos para macOS y Windows dentro del pipeline de build multiplataforma de Tauri.
architecture.ts
1 const shell = [ "Tauri", "Rust" ];
2 const ui = [ "React", "TypeScript" ];
3 const ia = [ "Inferencia Rust nativa", "Modelo de voz en el dispositivo" ];
4 const almacenamiento = [ "SQLite", "ffmpeg" ];
EL STACK

Tecnologías utilizadas.

Shell
TauriRust
UI
ReactTypeScript
IA
Inferencia Rust nativaModelo de voz en el dispositivo
Almacenamiento
SQLiteffmpeg
LO QUE ESTO DEMUESTRA

Lo que Keevo demuestra.

IA en el dispositivo

Entregado un pipeline de inferencia en Rust en producción dentro de Tauri sin bloquear el hilo de la UI.

Rendimiento de escritorio

Procesa una hora de metraje en menos de 4 minutos mediante una arquitectura de inferencia con pool de workers.

Privacidad por diseño

Cero dependencia de la nube — todo el procesamiento permanece local, haciéndolo viable para grabaciones de clientes y sensibles.

Build multiplataforma

Empaquetado de binarios nativos para macOS y Windows mediante el pipeline de build único de Tauri.

TRABAJEMOS JUNTOS

¿Quieres construir algo así?

Tráeme tu idea o proyecto a medio construir. Lo defino, lo diseño y lo entrego — usando el mismo flujo de trabajo detrás de Keevo.

Siguiente caso de estudio EduMation