Langswap становится Open Source! — 11 июня 2026 г. в 14:11:16.527
Langswap становится Open Source! Как я уже много раз говорил, мы публикуем исходный код нашего перевода видео, который используется на сайте langswap.app. В коде в какой-то момент было много know-hows, но последняя итерация была больше на упрощение и на ускорение пайплайна. Сейчас под капотом там следующее: Сначала мы разделяем аудио на речь и фоновые звуки здесь Фоновые звуки (музыку, шум) нам нужно оставить как есть. Затем с помощью whisper распознаём всё что там есть. и уточняем границы распознанного с помощью VAD. Присваиваем сегментам спикера. Потом просим Gemma-4-E2B перевести нам всё и считаем гласные. Если сильно уехали по длине, просим гемму переделать 1-2 раза. Потом, с новыми текстами, синтезируем речь через OmniVoice, используя исходный аудио сегмент как референс. В конце, заменяем аудиодорожку на видео и добавляем watermark что переведено с помощью langswap и какой-то матери В целом, это довольно простой, казалось бы, пайплайн, но как же долго и много это раз переизобреталось, вносились новые ТТС системы, изобретались способы контроля длины речи. В последней итерации, я удалил большую часть кода, чтобы вам было проще ориентироваться и контрибьютить. Почитать про этот перевод на forbes: Спасибо что были подписаны всё это время! Полезные ссылки: - https://github.com/langswap-app/langswap/blob/main/langswap/ml/speech_to_text_service/speech_to_text_manager.py - https://github.com/langswap-app/langswap/blob/main/langswap/ml/speech_to_text_service/asr_vad_client.py - https://github.com/langswap-app/langswap/blob/main/langswap/ml/translation_service/translator_llamacpp_client.py

