Лекция посвящена основам написания отказоустойчивого кода. Разбираются типичные ошибки, которые на практике приводят к падению высоконагруженных систем. В первой части рассмотрены проблемы, которые возникают на уровне сервиса: пулы ресурсов, их перегрузка, медленный старт и graceful shutdown. Вторая часть поднимается до уровня межсервисного взаимодействия, подробно рассматриваются виды таймаутов, техники балансировки и проблемы ретраев. В заключительной части затронуты вопросы мониторинга и реакций на инциденты.
Презентация:
https://cloud.mail.ru/public/JiQq/UpgtJcUqh