การวินิจฉัย SRE แบบ Agentic: เซิร์ฟเวอร์ MCP สำหรับการแก้ไขปัญหาโครงสร้างพื้นฐาน
Srelens ซึ่งพัฒนาโดย Srelens เป็นเซิร์ฟเวอร์ MCP ที่จัดเตรียมผู้ช่วย AI สำหรับงาน Site Reliability Engineering มันเชื่อมต่อไคลเอนต์โมเดลภาษาเข้ากับสถานะคลัสเตอร์และข้อมูลบันทึก โดยอัตโนมัติเรียกคืนเอกสาร รายการเหตุการณ์ และข้อความบันทึกเพื่อให้ตัวแทนสามารถติดตามกระบวนการวินิจฉัยที่มีการแนะนำ ความสามารถหลักรวมถึงเครื่องมือวินิจฉัย Kubernetes แคตตาล็อกคำสั่งที่ขยายได้ และการเรียกคืนบริบทโดยอัตโนมัติ เครื่องมือนี้มุ่งเป้าไปที่ SREs และทีม DevOps ที่ต้องการการช่วยเหลือจากเครื่องในการจัดการเหตุการณ์ภายในกระบวนการทำงานที่มีอยู่แล้ว
คุณสามารถใช้มันทำงานอะไรได้บ้าง?
เครื่องมือนี้ทำหน้าที่เป็นเซิร์ฟเวอร์ MCP เฉพาะด้านที่ให้ผลลัพธ์ที่มุ่งเน้น SRE สำหรับการตอบสนองต่อเหตุการณ์ มันสร้างแนวทางการวินิจฉัยที่มีโครงสร้างและข้อมูลสำหรับงานต่างๆ เช่น: การวิเคราะห์ความล้มเหลวของ pod, การตรวจสอบจุดสิ้นสุดของบริการ, และ การคัดแยกทรัพยากรของโหนด.
- ตรวจสอบ CrashLoopBackOff หรือ pods ที่รอดำเนินการโดยใช้การกระตุ้นที่เตรียมไว้
- วิเคราะห์ความกดดันของโหนดและข้อจำกัดของทรัพยากร
- รวบรวมเอกสารและสตรีมเหตุการณ์สำหรับขั้นตอนการหาสาเหตุ
ความเชื่อถือได้ของการวินิจฉัยที่ขับเคลื่อนด้วยโมเดลในทางปฏิบัติเป็นอย่างไร?
Srelens ป้อนเอกสาร เหตุการณ์ และบันทึกลงในหน้าต่างบริบทของโมเดล ซึ่งช่วยปรับปรุงพื้นฐานข้อเท็จจริงของแนวทางที่สร้างขึ้นเมื่อเปรียบเทียบกับการกระตุ้นแบบตาบอด โครงการนี้สนับสนุนการทำงานที่มีมนุษย์อยู่ในลูปอย่างชัดเจนซึ่งเรียกว่า การเข้าถึงโครงสร้างพื้นฐานที่มีอำนาจ ดังนั้นการดำเนินการที่ตั้งใจจึงถือว่าต้องมีการตรวจสอบจากผู้ปฏิบัติงานเกี่ยวกับการแก้ไขที่แนะนำ ความเชื่อถือได้จึงขึ้นอยู่กับความถูกต้องของข้อมูลที่ดึงมาและการตรวจสอบการกระทำที่แนะนำโดยผู้ปฏิบัติงาน.
มันต้องการข้อมูลนำเข้าอะไรบ้างและมีข้อจำกัดในการปรับใช้หรือไม่?
เซิร์ฟเวอร์มักทำงานเป็นกระบวนการ Node.js และต้องการการเข้าถึงโครงสร้างพื้นฐานเป้าหมาย เช่น ผ่าน kubectl นอกจากนี้ยังคาดหวังให้มีลูกค้าที่สอดคล้องกับ MCP เช่น Claude Desktop, Cursor หรือการรวมเข้ากับโปรแกรมแก้ไขเพื่อเชื่อมต่อ ข้อกำหนดเหล่านี้หมายความว่าเครื่องมือไม่สามารถผลิตการวินิจฉัยที่มีความหมายได้หากไม่มีการเข้าถึงเครือข่ายและข้อมูลประจำตัวไปยังสภาพแวดล้อมที่มันตรวจสอบ และมันพึ่งพาความสามารถของโฮสต์ในการรวบรวมบันทึกและเอกสาร.
มันง่ายที่จะรวมเข้ากับกระบวนการ SRE และข้อมูลถูกจัดการอย่างไร?
Srelens ใช้โปรโตคอล Model Context ดังนั้นเครื่องมือจึงสามารถเชื่อมต่อกับลูกค้าที่สนับสนุนใด ๆ และสามารถขยายได้ผ่านฐานข้อมูลโค้ดแบบเปิดของมัน การปรับใช้ทั่วไปในฐานะเซิร์ฟเวอร์ Node.js ด้านโฮสต์จะวางการประมวลผลไว้ที่ที่มีการเข้าถึง kubectl ซึ่งสนับสนุนการเก็บข้อมูลให้อยู่ภายในเครือข่ายการดำเนินงาน ทีมงานต้องวางแผนการปรับแต่งที่เก็บและการกระตุ้นเพื่อให้ผลลัพธ์สอดคล้องกับกระบวนการเหตุการณ์ที่มีอยู่และการควบคุมการเข้าถึง.
เหมาะที่สุดสำหรับทีม SRE ที่ยอมรับการตรวจสอบของผู้ปฏิบัติงานเกี่ยวกับคำแนะนำของโมเดล
Srelens เป็นตัวเลือกที่ใช้งานได้จริงสำหรับทีมที่ต้องการการแก้ไขปัญหาที่ช่วยด้วยโมเดลร่วมกับการดูแลของผู้ปฏิบัติงาน; มันถูกออกแบบมาเพื่อเสริม ไม่ใช่แทนที่ การตอบสนองต่อเหตุการณ์ของมนุษย์ คาดว่าจะต้องใช้เวลาในการกำหนดค่าคำสั่งและการปรับใช้ให้ตรงกับนโยบายการดำเนินงานของคุณ และถือว่าคำแนะนำการแก้ไขที่สร้างขึ้นเป็นข้อเสนอที่ต้องการการตรวจสอบก่อนการดำเนินการ.