В конце апреля команда GPTunneL запустила Grom TV — сервис, который называет первым в России бесконечным онлайновым ИИ-телевизором. Любой желающий заходит на сайт, регистрируется, пишет текстовый промпт в чат — и через 20–25 секунд видит на экране сгенерированный нейросетью видеоролик, который одновременно смотрят другие зрители. Под «телевизором» идёт общий чат, куда можно отправлять свои запросы.
Формат рассчитан на развлекательный контент: пользователи придумывают кроссоверы вроде «Уолтер Уайт варит зелья на уроке Снейпа» или «Микки Маус в стиле Noir». Нейросеть уже знает, как выглядят популярные персонажи, поэтому задача пользователя — сформулировать идею, а не рисовать. Видео сопровождается звуком, а при наличии речи модель синхронизирует движения губ с репликой.
| Параметр | Значение |
|---|---|
| Длина клипа | 8 секунд видео + синхронный звук |
| Время генерации | ~7,8 секунды |
| Частота кадров | ~24 fps |
| Коэффициент реального времени | 0,97 (генерация быстрее эфира) |
| Задержка «промпт зрителя → экран» | ~8–25 секунд |
| Запас видео впереди зрителя | всегда не менее ~8 секунд |
Главная техническая особенность — работа в реальном времени. Обычная видеогенерация — асинхронный процесс: отправил запрос, подождал, получил файл. В прямом эфире нельзя отставать: если генерация замедлится хотя бы на полсекунды, эфир начнёт заикаться или остановится. В Grom TV один ролик длится 8 секунд, а на его создание уходит около 7,8 секунды. Коэффициент реального времени — 0,97, то есть генерация чуть опережает воспроизведение. Всё это работает на одном чипе Nvidia B200 (иногда подключается второй для оптимизации).
Архитектура Nvidia Blackwell, к которой относится B200, проектировалась для обучения и инференса больших моделей, а не для потоковой генерации. Чтобы адаптировать её под эфир, разработчики используют ffmpeg: он за ~0,3 секунды на CPU подгоняет темп воспроизведения под скорость генерации, накладывает фирменный «плёночный» стиль (зерно, виньетку, мягкую цветность) и нарезает видео на двухсекундные сегменты с ключевыми кадрами. Это позволяет плееру стартовать быстро и переключаться между клипами без рывков. Трансляция идёт через HLS-плейлист, который поддерживают браузеры, VLC и смарт-телевизоры.
Когда очередь пользовательских промптов пустеет, в дело вступает Grom GPT — LLM-модель GPTunneL, которая сама придумывает сюжеты и подкидывает их в эфир, чтобы канал не замолкал. Таким образом, контент генерируется непрерывно, даже если зрители неактивны.
Мировых аналогов у формата немного. Самый известный — Nothing, Forever, запущенный студией Mismatch Media на Twitch в конце 2022 года. Это бесконечная пародия на «Сайнфелд», где реплики персонажей генерировала LLM, а озвучку синтезировала речь. Проект быстро приобрёл популярность, но Grom TV отличается тем, что каждый зритель может влиять на контент в реальном времени, а не только наблюдать за заранее заданным сценарием.
Сейчас Grom TV работает в тестовом режиме, и команда собирает обратную связь. О планах по монетизации или масштабированию в публичном доступе не сообщается. Для GPTunneL это эксперимент на стыке генеративного видео и стриминга, который показывает, насколько далеко можно продвинуть инференс моделей в условиях жёстких временных ограничений.
