Deepgram, поставщик моделей распознавания и синтеза речи, представил два новшества для своих развертываний на Amazon SageMaker ИИ: Deepgram Enhanced Metrics и поддержку Prometheus и OpenTelemetry. Эти инструменты призваны закрыть давний пробел в наблюдаемости self-hosted речевых ИИ-сервисов: до сих пор пользователи видели лишь базовые метрики вроде количества запросов, но не могли понять, за что именно они платят и как загружены GPU.

Первое новшество — Deepgram Enhanced Metrics — публикует данные о биллинге и использовании функций прямо в Amazon CloudWatch. Метрики передаются через Embedded Metric Format (EMF), который CloudWatch Logs автоматически извлекает из логов контейнера. Это означает, что не требуется устанавливать агенты или sidecar-контейнеры, а также не нужны дополнительные IAM-разрешения. Метрики содержат consumed-unit значения, которые совпадают с теми, что используются для метеринга AWS Marketplace, поэтому пользователи могут сверять счета AWS с фактическим трафиком вплоть до модели и транспорта. Важно, что метрики агрегируются по всем Deepgram-эндпоинтам в аккаунте и регионе, но не позволяют фильтровать по конкретному эндпоинту или инстансу — для этого нужно использовать второй инструмент.

MetricUnitDescription
ConsumedUnitsCountBillable inference units for the request. Sum over a period is the total billed volume.
AudioDurationSecondsSecondsDuration of audio processed (speech-to-text).
CharCountCountCharacters synthesized (text-to-speech).

Второе новшество — поддержка Prometheus и OpenTelemetry — дает метрики уровня движка, включая per-GPU акселераторы и host-метрики. Эти метрики собираются через SageMaker ИИ detailed observability и доступны через PromQL из CloudWatch, Grafana или любого инструмента, совместимого с Prometheus. Это позволяет видеть, что происходит на каждом GPU, что критично для планирования мощностей и оптимизации затрат.

Оба решения работают в условиях сетевой изоляции AWS Marketplace, когда контейнер не может устанавливать исходящие соединения. Данные передаются по существующему пути логирования SageMaker-to-CloudWatch, поэтому не требуют открытия сетевых путей. Это важно для компаний с высокими требованиями к безопасности, которые выбирают self-hosted развертывание именно из-за контроля над данными.

Стоит отметить, что SageMaker ИИ имеет собственную функцию enhanced metrics (EnableEnhancedMetrics), которая добавляет per-instance и per-GPU измерения к стандартным метрикам. Deepgram Enhanced Metrics — это отдельная возможность, и в посте подчеркивается, что они дополняют друг друга. Пользователям, которые хотят получить полную картину, стоит использовать оба инструмента.

Для Deepgram это шаг к повышению прозрачности для корпоративных клиентов, которые все чаще требуют детализированной наблюдаемости и контроля затрат. В условиях растущей конкуренции на рынке речевых ИИ-моделей, такие функции могут стать решающим фактором при выборе поставщика.