Јавните предавања, граѓанските дебати, панел-дискусиите и техничките работилници создаваат непроценливо усно знаење кое пречесто останува заробено во часови аудио и видео снимки. Снимката без текст не може лесно да се пребарува, не може да се индексира, ниту прецизно да се цитира. Овој проект користи отворени невронски мрежи за автоматско препознавање говор (ASR) оптимизирани за македонски јазик преку забрзан цевковод што работи локално на достапен кориснички хардвер без предавање на аудиото на комерцијални сервери.

Архитектура: CTranslate2 и faster-whisper акцелерација

Оригиналната имплементација на OpenAI Whisper во PyTorch е исклучително бавна и бара огромни количини на работна меморија. За практична примена на сопствени машини го користиме енџинот CTranslate2 преку faster-whisper: - Прилагодени тензорски јадра: CTranslate2 ја заменува општата Python/PyTorch околина со високо оптимизирани C++ рутини со поддршка за CUDA/cuDNN на графички картички и SIMD инструкции (AVX-512, AVX2, ARM NEON) на процесори. - Драматично зголемена брзина: До 4 пати поголема брзина на транскрибирање во споредба со оригиналната PyTorch верзија при идентична акустична прецизност.

Локална GPU и CPU квантизација (INT8 / FP16)

Клучниот пробив за локално извршување е квантизацијата на тежините на невронската мрежа: - 8-битна квантизација (INT8): Со претворање на 32-битните подвижни точки во 8-битни цели броеви со динамичко скалирање, меморискиот отпечаток на најголемиот модел Whisper large-v3 се намалува за над 65% — од огромни 6.2 GB на само ~2.1 GB. - Извршување на достапни потрошувачки графички картички: Моделот large-v3 непречено се вчитува и работи на картички со 6GB или 8GB VRAM (како NVIDIA GTX 1660 Ti, RTX 3060 или половни работни станици). - Ефикасно CPU извршување: На обични лаптопи со модерни повеќејадрени процесори (Intel i5/i7, AMD Ryzen или Apple Silicon), моделот користи 4 до 8 паралелни нишки со int8_float16 конверзија, постигнувајќи транскрипција побрза од реалното време на говор (RTF < 0.6).

Отворен цевковод: VAD филтрирање и временски жигови

За да се елиминираат халуцинациите и прецизно да се синхронизира текстот со аудиото, снимките поминуваат низ специјализиран цевковод: 1. Детекција на глас (Voice Activity Detection - Silero VAD): Пред влезот во трансформерот, аудиото се скенира со 30-милисекундни прозорци за да се изолираат вистинските сегменти со говор. Тишината, музиката, аплаузите и позадинскиот шум од вентилација веднаш се отстрануваат, спречувајќи повторување на фрази. 2. Пребарување со зрак (Batched Beam Search): Се користи големина на зрак (beam size) од 5 со прогресивно зголемување на температурата (0.0, 0.2, 0.4, 0.6, 0.8) при откривање на повторувачки токени. 3. Прецизно временско порамнување (Word-Level Timestamps): Со анализа на вкрстената матрица на внимание (cross-attention weights) во енкодерот, системот доделува точни почетоци и краеви за секој изговорен збор. 4. Автоматски извоз на формати: Цевководот генерира SRT и WebVTT фајлови со титлови за видео, како и чисти структурирани Markdown записи со ознаки на говорниците.

Дигитална јавна архива и суверенитет на знаењето

Отворената транскрипција го трансформира снимениот материјал во трајно јавно богатство: - Пребарливост и индексирање: Секое предавање за соларни батерии, децентрализирани мрежи или еколошки прашања веднаш станува пребарливо во локални пребарувачи и достапно за преглед. - Офлајн интеграција во Kiwix: Транскрибираните предавања се пакуваат во локалната база на нашите соларни јазли, овозможувајќи читање и учење дури и на најоддалечените локации. - Јазична еднаквост: Го надминуваме јазичниот јаз и овозможуваме прецизен превод на балканските јазици. Сите скрипти, Docker контејнери и веб-интерфејси за транскрипција се целосно отворени за самостојна инсталација.