В конце апреля команда GPTunneL запустила Grom TV — сервис, который называет первым в России бесконечным онлайновым ИИ-телевизором. Любой желающий заходит на сайт, регистрируется, пишет текстовый промпт в чат — и через 20–25 секунд видит на экране сгенерированный нейросетью видеоролик, который одновременно смотрят другие зрители. Под «телевизором» идёт общий чат, куда можно отправлять свои запросы.

Формат рассчитан на развлекательный контент: пользователи придумывают кроссоверы вроде «Уолтер Уайт варит зелья на уроке Снейпа» или «Микки Маус в стиле Noir». Нейросеть уже знает, как выглядят популярные персонажи, поэтому задача пользователя — сформулировать идею, а не рисовать. Видео сопровождается звуком, а при наличии речи модель синхронизирует движения губ с репликой.

ПараметрЗначение
Длина клипа8 секунд видео + синхронный звук
Время генерации~7,8 секунды
Частота кадров~24 fps
Коэффициент реального времени0,97 (генерация быстрее эфира)
Задержка «промпт зрителя → экран»~8–25 секунд
Запас видео впереди зрителявсегда не менее ~8 секунд

Главная техническая особенность — работа в реальном времени. Обычная видеогенерация — асинхронный процесс: отправил запрос, подождал, получил файл. В прямом эфире нельзя отставать: если генерация замедлится хотя бы на полсекунды, эфир начнёт заикаться или остановится. В Grom TV один ролик длится 8 секунд, а на его создание уходит около 7,8 секунды. Коэффициент реального времени — 0,97, то есть генерация чуть опережает воспроизведение. Всё это работает на одном чипе Nvidia B200 (иногда подключается второй для оптимизации).

Архитектура Nvidia Blackwell, к которой относится B200, проектировалась для обучения и инференса больших моделей, а не для потоковой генерации. Чтобы адаптировать её под эфир, разработчики используют ffmpeg: он за ~0,3 секунды на CPU подгоняет темп воспроизведения под скорость генерации, накладывает фирменный «плёночный» стиль (зерно, виньетку, мягкую цветность) и нарезает видео на двухсекундные сегменты с ключевыми кадрами. Это позволяет плееру стартовать быстро и переключаться между клипами без рывков. Трансляция идёт через HLS-плейлист, который поддерживают браузеры, VLC и смарт-телевизоры.

Когда очередь пользовательских промптов пустеет, в дело вступает Grom GPT — LLM-модель GPTunneL, которая сама придумывает сюжеты и подкидывает их в эфир, чтобы канал не замолкал. Таким образом, контент генерируется непрерывно, даже если зрители неактивны.

Мировых аналогов у формата немного. Самый известный — Nothing, Forever, запущенный студией Mismatch Media на Twitch в конце 2022 года. Это бесконечная пародия на «Сайнфелд», где реплики персонажей генерировала LLM, а озвучку синтезировала речь. Проект быстро приобрёл популярность, но Grom TV отличается тем, что каждый зритель может влиять на контент в реальном времени, а не только наблюдать за заранее заданным сценарием.

Сейчас Grom TV работает в тестовом режиме, и команда собирает обратную связь. О планах по монетизации или масштабированию в публичном доступе не сообщается. Для GPTunneL это эксперимент на стыке генеративного видео и стриминга, который показывает, насколько далеко можно продвинуть инференс моделей в условиях жёстких временных ограничений.