1、深入了解您的系统、服务和应用程序真 正在做什么可观察性 初学者指南可观察性 初学者指南|Splunk2可观测性被称为一切,从流行的技术流行语到一个“类固醇监测”的必备条件。事实更加复杂,尤其是考虑到现代基础设施的复杂性增加,并且,毫无疑问,需要在堆栈和系统中进行更高、更深和更好地监控。要求运维可见性的团队已经扩展到系统管理员和 IT 运营分析师之外,甚至开发人员也更加了解如何获得更好的客户体验。为了有效地做到这一点,所有角色都需要在其整个架构中具有可见性,从第三方应用程序和服务到他们自己的应用程序和服务,以修复并最终防止问题。当这种能力成为可观察性的前提时,它不仅使可见性变得更容易,使洞察力更
2、强,并为更具战略性的计划留出更多时间,而且对现场可靠性工程(SRE)的整体成功也至关重要。这在发布代码的开发人员和维护受代码影响的基础设施的操作人员之间提供了一座桥梁。最重要的是,它将一些监控工作转移到了开发上。在本指南中,我们将定义什么是可观察性,以及实现它需要什么。我们还将提供一些可观察性的例子,并为帮助您的组织实现可观察性的解决方案提供指导。目录第 1 章可观察性-它是什么和不是什么.5第 2 章可观察性路线图.8第 3 章行动中的可观察性.14第 4 章可观察性选项.21可观察性 初学者指南|Splunk4可观察性 初学者指南|Splunk5第 1 章可观察性-它是什么和不是什么简介建
3、立反馈简单地说,可观察性就是利用系统和应用程序来收集指标和日志。它构建应用程序的想法是有人会观看它们。它来自系统控制理论,这是反馈系统的基础,通过可观察性,可以衡量系统内部状态可以从其外部输出 1(一种数字输出)的知识中推断出的程度。将它视为系统的一个属性-另一个属性,例如功能性、性能或可测试性。您可以使用各种工具对系统进行监控。但如果系统无法很好地体现其状态,您就无法弄清楚系统到底出了什么问题,进而就会陷入困境。”21.“Observability,”维基百科,2018 年。2.Ernest Mueller,“Monitoring and Observability,”,2018 年 2 月
4、。“可观察性 初学者指南|Splunk6可观察性和监控由于监控和可观察性经常被混淆或互换,所以对二者进行比较有助于区分和定义它们。监控可观察性告诉你系统运行是否正常允许你查询系统运行不正常 的原因一系列有关系统的指标和日 志记录传播该系统的相关信息以故障为中心理解系统行为,无论是否停机“运维方式”/你采取的措施“运维目标”/你具备的条件我对你进行监控你让自己可以被观察到监控可预见 的失败尽力模拟 失效模式测试尽力验证 正确性可观察性全部和部分失败的所有可能排列可观察性 初学者指南|Splunk7可观察性即文化可观察性不能代替监控;它们是互补的。但是如果没有一种可观察性文化,几乎不可能进行有效的
5、监控。仅有工具还远远不够,也没有什么东西能神奇地“给您”可观察性。可观察性的价值 规划与开发 解决问题 推动更有用的事故审查 提高正常运行时间和性能作为一种文化,可观察性是一个团队或公司重视检查和理解系统、它们的工作量和它们的行为的能力的程度。具有强大可观察性文化的公司通常有可观察性团队,尽管它们可能没有这样命名。如果可观性是一种文化价值,那么,想要的结果就会随之而来。”Andi Mann,Splunk首席技术倡导者“可观察性 初学者指南|Splunk8可观察性的支柱在更加清晰地了解什么是可观察性后,下一步就是实现它。以下三个支柱对于实现可观察性至关重要:跟踪一些专用的数据,用于显示哪一行代码
6、未能在单个用户级别更好地了解已发生的事件指标一些专用的数字,用于描述在一定时间间隔内测量的特定过程或活动事件随着时间推移发生的离散事件的不可变记录第 2 章可观察性 路线图可观察性 初学者指南|Splunk9现代事件处理技术有三种技术用于处理事件,最终目标是实现共享见解、协作响应、数据支持的 IT 和智能操作。添加上下文确定解决方案的优先级,以确保服务的可用性,提供业务详细信息并增强对ITSI服务的见解去除垃圾邮件从噪音中分离出有价值的信号收集所有相关数据这可以跨堆栈、技术和所有环境实现完全可见性:云原生 传统、内部、整体等 混合环境可观察性 初学者指南|Splunk10AI 和 ML 的作用