Команда DevCrowd опубликовала итоги опроса о том, как устроена работа специалистов, отвечающих за надежность цифровых сервисов. Опрос проводился с 1 октября по 1 ноября 2025 года и охватил 273 сотрудника, работающих инженерами по надежности сервисов (Site Reliability Engineering, SRE), DevOps, платформенными инженерами и системными администраторами. Респондентами стали в основном российские специалисты (97,1%).
В опросе рассматривались реальные задачи и зоны ответственности этих ролей, подходы к разделению или совмещению SRE и DevOps, применяемые инструменты контроля и алертинга (Alerting), а также взаимодействие инженеров с разработкой, командами безопасности и руководством в компаниях разного масштаба.
Ключевые выводы:
- почти 70% специалистов с опытом в информационных технологиях более 10 лет пришли в инженерию надежности сервисов в последние 1–5 лет. Во всех возрастных группах большинство начали заниматься надежностью сравнительно недавно;
- как выяснилось в ходе опроса, в компаниях до 150 человек за надежность чаще всего отвечают 1–2 инженера. В крупных организациях формируются отдельные департаменты надежности с десятками и сотнями SRE;
- платформенные инженеры чаще других участвуют в дежурствах по инцидентам и работают с целями и показателями надежности (Service Level Objectives и Service Level Indicators). У SRE заметно больше задач на стыке инженерии и продукта;
- 88,2% опрошенных SRE называют основной задачей реакцию на инциденты и разбор их причин. Для DevOps ключевым является управление конфигурацией инфраструктуры (82,9%), а для системных администраторов — автоматизация рутинных операций и создание внутренних инструментов (95,7%), а также контроль систем (95,7%);
- 53% инженеров по надежности напрямую взаимодействуют с руководством. 89,3% регулярно сотрудничают с разработчиками и продуктовыми командами, 76,5% — с инфраструктурными инженерами, 66,9% — с командами информационной безопасности (Security Operations);
- среди основных трудностей своей работы респонденты чаще всего называют нехватку времени на повышение стабильности сервисов (50,4%), сложность отстаивания инженерных решений (49,2%) и размытые зоны ответственности (41,4%);
- в 51% организаций роли SRE и DevOps не разделены формально, и масштаб компании практически не влияет на этот выбор;
- лишь 50% команд формализовали процесс реагирования на инциденты. Автоматическая маршрутизация применяется только у трети организаций, а специализированные инструменты вроде PagerDuty или OpsGenie используют около 25% компаний;
- как выяснилось в ходе опроса, для отслеживания доступности сервисов 79,2% опрошенных используют алерты и уведомления по метрикам, 76,2% — внутренние дашборды в системах визуализации вроде Grafana или Kibana, 53,2% — показатели доступности и ошибок. При этом четверть компаний применяют собственные инструменты контроля;
- 63% команд разрабатывают свои инструменты надежности внутри компании. Наиболее часто для этого используются Python (64,8%) и Go (41,3%), тогда как Bash и Shell применяются в основном для вспомогательных скриптов;
- лучшими работодателями респонденты называют Т-Банк (52,6%), «Авито» (47,4%) и Ozon (45,4%). В десятку лидеров входят «Яндекс», банк «Точка», Positive Technologies, Yadro, Lamoda, Альфа-Банк и Райффайзенбанк.