AI / Desktop

Transcribe

O aplicație desktop care rulează local, pentru înregistrarea și transcrierea conversațiilor de lucru: Whisper pe GPU-ul tău, transcriere live frază cu frază, rezumate AI structurate și niciun fișier audio care să părăsească vreodată calculatorul tău.

Context

Ședințele, interviurile și apelurile cu clienții conțin decizii pe care nu le notează nimeni. Serviciile de transcriere din cloud rezolvă asta cu prețul trimiterii fiecărei înregistrări către un terț — inacceptabil pentru discuții sub NDA, pentru domenii reglementate sau pur și simplu pentru limba română, unde calitatea serviciilor găzduite este inegală.

Problema de inginerie este fiabilitatea pe un laptop, nu scalarea în cloud: o înregistrare trebuie să supraviețuiască unei blocări a browserului sau închiderii capacului, modelul de recunoaștere vocală trebuie să ruleze indiferent de GPU-ul calculatorului, iar stratul de rezumare trebuie să trateze transcrierea ca pe o sursă de date neverificate.

Ce am construit

Aplicația acoperă înregistrarea live, transcrierea în lot a fișierelor existente, rezumatele structurate și căutarea în toate înregistrările — totul pe calculatorul tău.

  • Motor de recunoaștere vocală independent de backend — o singură interfață alege automat backend-ul Whisper pentru Apple Metal, CUDA sau CPU, cu fallback, astfel încât aceeași bază de cod poate fi livrată pe Mac și Windows fără ramuri separate.
  • Înregistrare live rezistentă la blocări — fișierul audio este jurnalizat în fragmente numerotate, idempotente și scrise cu fsync, cu heartbeat și un manifest persistent; în caz de blocare sau de intrare în repaus se pierd câteva secunde, nu întreaga sesiune, iar joburile întrerupte se reiau la pornire.
  • Transcriere în două treceri — o trecere live rapidă afișează frazele pe măsură ce vorbești și este calibrată pentru a limita deriva, în timp ce transcrierea salvată este obținută prin procesarea separată, la calitate maximă, a întregii înregistrări audio, cu detecția activității vocale și praguri de detectare a halucinațiilor.
  • Rezumate în sandbox — rezumatele structurate (titlu, puncte-cheie, decizii și acțiuni) și conversațiile bazate pe transcrieri rulează fie pe modele locale, fie prin CLI-urile furnizorilor, într-un sandbox read-only cu uneltele dezactivate, deoarece textul transcris este o sursă de date neverificate.
  • Limite care produc erori vizibile — aplicația refuză prompturile care depășesc fereastra de context a unui model local, în loc să lase modelul să omită instrucțiuni fără avertisment și să producă un rezumat convingător, dar greșit.

Stack

Python cu Flask care ascultă doar pe localhost, Whisper prin mlx-whisper sau faster-whisper, ffmpeg pentru decodare, reducerea zgomotului și normalizarea volumului, modele locale prin Ollama sau CLI-urile Claude și Codex pentru rezumate, o interfață JavaScript fără dependențe și fișiere JSON persistente, alături de fișierele audio de pe disc, în locul unei baze de date. Aplicația este împachetată pentru macOS și Windows. Suita de teste offline folosește injectarea de erori (stare coruptă, scrieri eșuate și operațiuni de finalizare concurente) și contracte statice pentru accesibilitate și paritatea traducerilor.

Status

Produs intern. Este disponibil într-o versiune privată, la cerere; aceeași abordare se aplică oricărui flux în care fișierele audio nu pot părăsi sediul.

Ai ceva care merită construit?

Începe un proiect