GitHub опубликовал подробный разбор крупного сбоя, который произошёл 17 августа и длился 7 часов 47 минут. Инцидент затронул github.com, аутентификацию, GitHub Actions, API, pull request’ы, задачи и сервис Copilot, нарушив работу разработчиков и компаний по всему миру.
Это уже второй серьёзный инцидент GitHub в августе, после сбоя GitHub Actions 6 августа. Руководство компании признаёт, что при уже начатом курсе на повышение устойчивости платформы нужно ускорить работы по повышению доступности.
Расследование показало, что сбой начался в момент нового пикового трафика, когда критически важный инфраструктурный компонент в дата-центре Central US не смог масштабироваться под нагрузку. Возникший дефицит ресурсов распространился по системе, вызвал ошибки аутентификации и массовые сбои сервисов GitHub.
Для восстановления работы потребовались согласованные действия нескольких команд. Специалисты перераспределили трафик, изолировали затронутую инфраструктуру и поэтапно вернули сервисы в строй. Большинство функций GitHub были восстановлены в тот же день, но некоторые сервисы Copilot вернулись позже из‑за ошибки на стороне клиента, запускавшей повторные запросы, что дополнительно увеличивало нагрузку при восстановлении.
GitHub подчёркивает, что оба августовских инцидента не были связаны с изменениями кода или конфигураций. Их основной причиной стали проблемы ёмкости: критически важные компоненты не были масштабированы до того, как спрос превысил их возможности. С апреля количество ежемесячных коммитов на платформе выросло с 1,4 до 2,9 млрд, что усилило нагрузку, но, по словам компании, не оправдывает такие простои.
В рамках ранее объявленных обязательств по повышению доступности GitHub сосредоточился на трёх задачах: наращивание ресурсов, повышение эффективности и устранение архитектурных узких мест. Компания добавила более 3 млн вычислительных ядер CPU, 120 Пбайт высокоскоростного хранилища и увеличила пропускную способность сети. В существующих дата-центрах установлено максимум оборудования, который позволяет доступное энергопитание, параллельно ускоряется миграция в Azure.
На данный момент около 58% нагрузки платформы GitHub и половина всех Git‑операций обрабатываются в Azure, тогда как в мае доля платформенной нагрузки составляла 12%. Расширение инфраструктуры Azure также поддержало рост числа задач в GitHub Actions и помогло масштабировать самые крупные монорепозитории.
Следующая цель GitHub — архитектура, которая масштабирует ёмкость на чтение пропорционально числу читателей, что фактически снимает ограничения по количеству операций чтения. Внедрение этой архитектуры начнётся поэтапно, начиная с крупнейших монорепозиториев.
Компания отмечает, что масштаб — не единственная проблема. По мере роста темпа и сложности изменений прежние операционные практики перестали соответствовать требованиям. GitHub перераспределил команды и ресурсы в пользу повышения доступности и инвестировал в более строгие тесты, безопасные выкаты, улучшенную наблюдаемость и систему оповещений. При этом работа ещё не завершена.
Дополнительно GitHub изолирует критические системы и убирает общие зависимости между ними. Это должно уменьшить вероятность сбоев и ограничить их влияние, если они всё же произойдут.
По результатам инцидентов 6 и 17 августа компания внедряет два срочных изменения. Во‑первых, вводятся единые лимиты на повторы запросов, «бюджеты» повторов и переменные тайм-ауты для взаимодействия сервисов, чтобы избежать штормов повторных запросов и каскадного роста нагрузки. Во‑вторых, GitHub пересматривает оповещения по менее приоритетным метрикам CPU и памяти, чтобы выявить компоненты, которые могут отказать при резком скачке трафика.
GitHub подчёркивает, что высокая доступность платформы — обязательство перед сообществом разработчиков, которое зависит от GitHub для разработки, поставки и эксплуатации программного обеспечения. Компания признаёт, что 17 августа не смогла обеспечить эту доступность, и заявляет, что намерена вернуть доверие через масштабирование и повышение устойчивости платформы.
Руководитель технического блока GitHub Владимир Фёдоров имеет многолетний опыт в инженерном менеджменте. До GitHub он соосновал стартап UserClouds, занимавшийся управлением данными и конфиденциальностью, 12 лет работал в Facebook (сейчас Meta) на позиции старшего вице-президента, где возглавлял инженерные команды по направлениям Privacy, Ads и Platform. Ранее он работал в Microsoft, окончил бакалавриат и магистратуру по информатике в Caltech и входит в совет директоров Codepath.org, организации, которая готовит новое поколение инженеров и технических руководителей с фокусом на ИИ.
По данным GitHub.
*Организация Meta (владелец Facebook и Instagram) признана экстремистской организацией и ее деятельность запрещена на территории России.






















