站点可靠性工程(,)是一门將软件工程应用于基础设施以及运营的学科,該概念由Google於2003年提出。站点可靠性工程主要目标是创建可扩展和高可用性的软件系统。
職責
站点可靠性工程师要花50%的时间来參與與軟件運營相关的工作,如解決问题、随叫随到和人工干预。由于站点可靠性工程师所负责的软件系统需要高度自动化和自我修复,所以站点可靠性工程师要将另外50%的时间用于开发工作,如增加新功能等工作。
参考文献
更多阅读
- Site Reliability Engineering: How Google Runs Production Systems, O'Reilly Media, April 2016, Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy,
- The Practice of Cloud System Administration: Designing and Operating Large Distributed Systems, Volume 2, Thomas Limoncelli,
- [https://landing.google.com/sre/interview/ben-treynor.html Google - Site Reliability Engineering interview with Ben Treynor]
评论 (0)