SLI【Service Level Indicator】サービスレベル指標
概要

SLIとして用いられる指標は、サービスの可用性や性能を数値で表したものが中心となる。稼働率、停止時間、エラー発生率、応答時間(レイテンシ)、単位時間あたりの処理件数(スループット)などである。何を選ぶかはサービスの種類や目的によって異なり、例えばWebサービスであればリクエストの成功率や応答速度、クラウドサービスであれば利用可能時間や障害発生頻度が指標となることが多い。
SLIの選択において重要なのは、利用者が実際に感じる品質と結び付いているかどうかである。サーバのCPU使用率やメモリ使用量はシステム内部の状態を示すが、利用者が認識する品質を直接表すとは限らない。利用者視点で測定できる指標をSLIとして設定することが推奨されている。
設定されたSLIは継続的に収集・監視され、サービスが目標とする品質水準を満たしているかの判断に用いられる。このSLIに対して設定される具体的な目標値を「SLO」(Service Level Objective)と呼び、「月間稼働率99.9%以上」「リクエストの99パーセンタイルの応答時間が200ミリ秒以下」のように表される。
運用担当者はSLIの実測値とSLOを比較しながら品質の維持・改善を図る。さらに、SLIやSLOをもとにサービス提供者が利用者に品質の最低保証を約束する契約や取り決めを「SLA」(Service Level Agreement)という。SLAには達成すべきサービス水準としてSLIやSLOが組み込まれ、未達時の補償条件なども定められる。
SLAは以前から用いられているが、これにSLI・SLOを組み合わせる考え方は、米グーグル(Google)社が提唱したサイト信頼性エンジニアリング(SRE)の普及と共に広く知られるようになった。大規模なクラウドサービスやWebサービスの運用において、サービスの信頼性を客観的な数値で継続的に管理するための基盤として活用されている。