Aiesa.ru - Российский разработчик ИИ для обработки речи
Бизнес · 17 февраля 2026 г.
Куда мы пропали и почему первый пост в новом году появился аж через полтора месяца? — 17 февраля 2026 г. в 05:29:22.849
Куда мы пропали и почему первый пост в новом году появился аж через полтора месяца? Спойлер: нет, мы не ушли в запой до февраля и не улетели «перезагружаться» на Бали. Всё прозаичнее и интереснее одновременно — мы строили будущее компании. Но обо всём по порядку. Год назад мы запустили Aiesa.ru с одной целью — залезть в новую революционную нишу — искусственный интеллект и разобраться, как он реально может решать задачи бизнеса и как на этом заработать.🤑 Мы взяли понятную нам бизнес-модель — сервисную разработку. Это когда клиенты приходят со своими задачами, а мы придумываем, что бы им такого напрограммировать. Классика ИТ-рынка. За год напряжённой работы мы сделали десятки решений как для клиентов, так и для себя: от ИИ-менеджера в чате поддержки до аналитики хоккейных матчей. Но цель проекта Aiesa.ru была всё же в другом — достаточно глубоко изучить рынок, чтобы запустить на нём свой продукт. 😤 Задача звучала просто, но была дьявольски сложной: Как на динамично развивающемся рынке, где каждый месяц всё меняется, создать продукт, который будет актуален не полгода, а ближайшие десять лет? И ответ, как это часто бывает, пришёл оттуда, откуда не ждали... Параллельно с клиентскими проектами наша команда создавала небольшие продукты для внутренних потребностей. Мы сделали генератор коммерческих предложений, случайно собрали аналог NotebookLM от Google и ещё кучу инструментов, которыми пользовались сами. Но один из них абсолютно неожиданно для нас — выстрелил. Телеграм-бот для расшифровки речи. Тот самый t.me/media_to_textbot. Мы делали его для себя, чтобы расшифровывать записи встреч с клиентами. Выложили в открытый доступ, думали, попользуются пару десятков наших друзей и знакомых. А сейчас в нём больше 3 000 пользователей, которые сделали уже 15 000 транскрибаций. Это полтора года общего хронометража аудио и видео, которые наш бот превратил в текст. Полтора. Года. Непрерывного. Звука. 🤯 И именно этот проект обратил наше внимание на огромную нишу — обработка речи. 😎Немного закулисья для тех, кому интересно, как это устроено. Для расшифровки речи используются специализированные ИИ-модели. Они тяжёлые и прожорливые — требуют серьёзных вычислительных мощностей. Когда мы запускали бота, перед нами стоял выбор: Путь А: пойти к условному Яндексу и покупать у них минуты расшифровки. Просто, быстро, но дорого — ты платишь за каждую секунду обработки и полностью зависишь от чужого сервиса. Путь Б: развернуть свои собственные модели на своих серверах. Сложнее, больнее, но ты платишь фиксированную стоимость за железо и не зависишь ни от кого. Мы, конечно, выбрали путь Б. Потому что мы в Aiesa.ru лёгких путей не ищем. Мы взяли Open-Source модели — это модели, которые другие компании обучили и выложили в открытый доступ. Их можно бесплатно скачать и запустить на своём сервере. Звучит как сказка, но есть нюанс: для их работы обычно нужны сервера с мощными видеокартами, которые стоят как подержанный автомобиль. В месяц. А наш сервер для таких задач не очень-то был предназначен. Для нас это был испытательный полигон, а не рабочая лошадка, поэтому задачи обработки тяжёлых моделей он тянул с натяжкой. 😤😤😤И тут мы начали изобретать. Мы написали собственный оркестратор — систему, которая разрезает большие задачи на маленькие куски и поочерёдно загружает их в память сервера. Представьте, что вам нужно перевезти шкаф, а у вас только легковушка. Большинство скажет: «Нужен грузовик». А мы сказали: «А если шкаф разобрать?» Если серьёзно — оркестратор умно распределяет нагрузку: пока одна часть модели удаляет тишину, другая расшифровывает аудио в текст. Это позволило нам добиться качества на уровне дорогих облачных решений при кратно меньших затратах на инфраструктуру. Именно поэтому наш бот распознаёт речь на высоком уровне, стоит дешево и работает быстро — мы не экономили на качестве модели, мы научились эффективно с ней работать.

