登录
下载
Skill UI
浏览并发现
15532+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
Runbook
,共找到
46
条记录
默认排序
最新上传
最多下载
混沌工程实战指南
chaos-engineer
Jeffallan/claude-skills
189
为分布式系统设计并执行混沌实验与故障注入框架(Chaos Monkey、Litmus 等),制定演练手册、失败回滚、安全控制与持续 CI/CD 抗脆弱流程。
查看详情
Clay平台事件应急手册
clay-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
408
这是一份全面的运行手册,用于诊断和解决基于Clay平台的生产环境事故。内容涵盖了结构化的快速分级(P1-P4)、故障排除步骤,以及解决凭证耗尽、Webhook失败和数据流中断等常见问题的详细指南,旨在最小化业务停机时间。
查看详情
Clerk故障应急处理手册
clerk-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
208
这是一份为工程团队设计的综合故障响应手册,用于处理与Clerk认证或SaaS平台相关的重大事故。它涵盖了完整的事故生命周期流程,包括最初的故障排查、紧急认证绕过、密钥轮换、会话恢复脚本和事后根本原因分析。当遇到生产环境认证故障或安全漏洞时使用。
查看详情
CodeRabbit 故障应急处理流程
coderabbit-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
346
这是一份全面的CodeRabbit故障应急手册,提供了处理服务中断、PR合并受阻或评论错误的分步指南。内容涵盖了快速排查、紧急绕过、环境检查、延时诊断和配置优化等步骤,确保在CodeRabbit功能失效时也能维持开发流程的连续性。
查看详情
智能报警规则创建
creating-alerting-rules
jeremylongshore/claude-code-plugins-plus-skills
66
该技能辅助 SRE/DevOps 团队自动设定延迟、错误率、吞吐量等性能警报,涵盖阈值、路由、升级策略及运行手册,降低误报并提升监控响应效率。
查看详情
Evernote故障应急手册
evernote-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
434
本手册是处理Evernote集成关键故障的详细流程指南。它涵盖了API中断、持续的速率限制、认证失败以及数据同步等问题的诊断和处理。当系统发生生产故障或服务中断时,遵循本手册可确保快速、系统地执行事件响应,包括激活熔断器和实现降级服务策略。
查看详情
Exa API故障应急处理手册
exa-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
286
本手册提供了一套结构化的流程,用于处理Exa搜索API的故障和集成问题。内容涵盖了从初步故障排查、分析不同HTTP错误码(如401、429、5xx),到实施缓解措施,再到完成全面事后回顾和根本原因分析的完整步骤指南。
查看详情
Gamma故障应急手册
gamma-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
374
本手册为Gamma集成故障的综合应急响应指南。它提供了结构化的分步诊断流程,用于应对生产环境中的各种严重故障,包括服务完全中断、API错误、请求限速和高延迟等问题,确保故障排除流程的系统性和高效性。
查看详情
Guidewire故障应急手册
guidewire-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
334
本手册提供了一套系统化的流程,用于应对Guidewire生产环境突发的各类故障。它详细指导用户完成整个事件管理周期,包括初期的故障分诊(检查监控、API错误和批处理日志)、诊断性能瓶颈(如JVM和查询性能),以及执行缓解和升级处理,确保故障能够及时、规范地恢复。
查看详情
LangChain生产事故处理手册
langchain-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
185
本手册提供了LangChain及大型语言模型(LLM)生产环境的标准化操作流程(SOP)。它详细指导运维工程师如何处理常见的突发故障,包括服务商中断、错误率飙升、延迟增加和成本超支等问题,并提供了相应的检测、诊断和缓解措施,是维护LLM应用的关键运维工具。
查看详情
Langfuse事件排障手册
langfuse-incident-runbook
jeremylongshore/claude-code-plugins-plus-skills
282
这是一份完整的Langfuse故障排查和应急响应手册。它提供了从初始故障分级、系统状态检查到解决常见问题(如追踪丢失、速率限制或服务中断)的详细步骤,确保用户能够快速恢复LLM应用的观测性监控。
查看详情
AI智能体生产就绪度检查清单
lindy-prod-checklist
jeremylongshore/claude-code-plugins-plus-skills
168
本清单是一份全面的AI智能体生产部署检查指南。它指导用户从开发/测试环境过渡到生产环境,重点覆盖了安全配置(密钥管理、SSO)、错误处理、监控设置、操作流程文档以及合规性要求(如HIPAA/GDPR)。确保AI Agent上线前达到最高的稳定性和可靠性。
查看详情
1
2
3
4
下一页
语言
简体中文
English