Đội đang chạy Loki làm hệ thống tập trung logs trên một cụm Kubernetes và bắt đầu thấy dung lượng ổ đĩa của persistent volume tăng đột ngột mà không có cảnh báo trước. Nguyên nhân là do Loki nhận lượng log vượt quá mức mong đợi vì cấu hình retention và labels không được áp dụng đúng, khiến các chunk log liên tục được ghi và không được dọn dẹp. Khi PVC đạt ngưỡng sử dụng, các node bắt đầu vào trạng thái disk‑pressure, dẫn tới việc Loki pod bị evicted, việc ingest logs ngừng và các cảnh báo hệ thống được kích hoạt. Việc khôi phục bao gồm việc dọn dẹp thủ công các chunk cũ, điều chỉnh tham số retention và max_age trong LokiConfig, đồng thời thiết lập giới hạn resource và alerts trên sử dụng PVC. Bài học là luôn cấu hình retention và compaction cho Loki, giám sát chỉ số PVC và đặt quota để ngăn ngừa hiện tượng “log storm” làm đầy ổ đĩa trong môi trường Kubernetes.
Why read it: Bài này giúp bạn học cách xử lý khủng hoảng dung lượng đĩa Loki trong Kubernetes qua kinh nghiệm thực tế từng bước cụ thể.
Answer 3 short questions to earn reward points for this article. Only do it if you want the points.
3 questions · under a minute · optional
Source: https://towardsdev.com/how-i-resolved-a-critical-loki-disk-space-crisis-in-kubernetes-809f2d0b0acd. 8 Sync News only summarizes and links out; content copyright belongs to the authors and original sources.
Đang tải bình luận…
Nhiều tổ chức đang đầu tư vào developer platform để giảm tải nhận thức và tăng tốc độ thay đổi. Các platform thường được xây dựng quá lớn, tích hợp quá nhiều công cụ và dịch vụ mà không có phản hồi thực tế từ đội ngũ sử dụng, dẫn đến sự dư thừa và khó bảo trì. Điều này làm tăngภาระ bảo trì, làm chậm quá trình tích hợp và thậm chí tăng tải nhận thức thay vì giảm nó, khiến đội ngũ ít sử dụng platform. Quyền quy mô nên bắt đầu từ một bộ tính năng tối thiểu mà đội ngũ thực sự cần, sau đó mở rộng dần dựa trên dữ liệu sử dụng và phản hồi liên tục. Kết quả là platform phù hợp với văn hóa kỹ thuật, giúp giảm tải nhận thức và thực sự tăng tốc độ entrega thay đổi.
Bài viết này giúp lập trình viên hiểu cách xây dựng nền tảng kỹ thuật phù hợp với nhu cầu thực tế của tổ chức để giảm gánh nặng nhận thức và đẩy nhanh tốc độ cung cấp thay đổi.
Khi phát triển dịch vụ microservice, việc kiểm tra khả năng chịu lỗi thường đòi hỏi môi trường staging riêng và có thể ảnh hưởng đến các team khác. mirrord Chaos Testing cung cấp công cụ cho phép desenvol viên inject lỗi kết nối tới bất kỳ dependency nào (database, API, message queue…) chỉ bằng một lệnh hoặc cấu hình đơn giản. Công việc này diễn ra trong quá trình chạy local hoặc trong container dev, không cần triển khai môi trường riêng và không làm gián đoạn việc làm việc của các thành viên khác. Nhờ đó,团队 có thể quan sát ngay cách mã nguồn phản hồi khi kết nối bị ngắt, timeout hoặc trả về lỗi, từ đó phát hiện các đường đi xử lý ngoại lệ chưa được покрыть. Kết quả là có thể cải thiện độ tin cậy của dịch vụ mà không tốn chi phí cho môi trường test phức tạp, và áp dụng được ngay trong quy trình CI/CD nếu muốn.
mirrord Chaos Testing giúp bạn phát hiện điểm yếu trong hệ thống của mình một cách an toàn và tiện lợi bằng cách mô phỏng các sự cố kết nối trong môi trường thực tế.
witr là công cụ truy vết nguyên nhân của tiến trình, port, container hay file đang chạy, hiển thị toàn bộ chuỗi khởi động từ systemd, supervisor, shell hay cron cùng thông tin người khởi động, thời gian, nguồn gốc và cảnh báo quan trọng. Có thể chạy dạng tương tác TUI hoặc script với định dạng đầu ra ngắn gọn (--short) hoặc JSON (--json), hỗ trợ đa nền tảng qua một file binary Go tĩnh.
Lập trình viên nên đọc bài này để hiểu cách khám phá và giải quyết nguyên nhân sâu sắc của các quá trình bất thường, container hoặc dịch vụ chạy trong hệ thống, từ nguồn gốc khởi động đến các cảnh báo quan trọng mà ps, top hoặc lsof không thể cung cấp.
Tôi tích hợp các công cụ hiện có trong ngữ cảnh AI để biến dữ liệu telemetry Application Insights thành báo cáo sức khỏe hàng ngày có thể hành động, giúp xác định vấn đề cần quan tâm và duy trì cuộc trò chuyện tiếp theo.
Bài viết này giúp lập trình viên tự động hóa việc giám sát hệ thống bằng AI để chuyển dữ liệu telemetry thành báo cáo sức khỏe hành động mỗi ngày.
Oxide điều chỉnh tích hợp Kubernetes dựa trên nhu cầu thực tế từ khách hàng.
Lập trình viên muốn tối ưu hóa triển khai và quản lý ứng dụng Kubernetes trong môi trường thực tế sẽ tìm hiểu cách Oxide đã điều chỉnh các tích hợp để đáp ứng nhu cầu cụ thể của khách hàng, giúp giải quyết những thách thức thực tế như hiệu suất, bảo mật và chi phí.
Việc triển khai validation cho Kubernetes có thể rút ngắn thời gian từ 45 phút xuống còn 2 phút bằng cách tự động hóa các kiểm tra sức khỏe runtime, giúp thu hẹp khoảng cách giữa pipeline CI/CD xanh và ứng dụng hoạt động ổn định.
Một lập trình viên cần đọc bài này để hiểu cách tối ưu hóa thời gian và độ tin cậy của quá trình deploy Kubernetes bằng cách tự động hóa kiểm tra sức khỏe tại thời điểm thực thi, giúp giảm thiểu rủi ro và tăng hiệu suất CI/CD.
Hầu hết các tutorial chỉ dạy cách chạy kubectl expose, nhưng thực tế dưới 10% kỹ sư truly hiểu những gì xảy ra sau lệnh đó. Nguyên nhân là họ không nắm rõ cách kube-proxy chuyển đổi Service ClusterIP thành các rule iptables hoặc IPVS, cũng như cách CNI plugin (ví dụ Cilium dựa trên eBPF) quản lý packet forwarding và chính sách mạng. Khi gặp sự cố như service không reachable, latency tăng đột ngột hoặc network policy không áp dụng, họ tốn thời gian debug vì thiếu mô hình mental về lớp dữ liệu và lớp điều khiển. Điều đáng học là đầu tư thời gian đọc source của kube-proxy, thử chuyển sang IPVS hoặc sử dụng Cilium để thấy trực tiếp eBPF trong hành động, từ đó tự tin mở rộng và tối ưu hoá mạng trong cluster. Bài viết cung cấp các diagram và lệnh tra cứu cụ thể (kubectl get endpoints, cilium status, iptables -L -t nat) giúp cầu nối giữa việc chỉ biết expose và thực sự hiểu Kubernetes networking.
Bài giải thích về Kubernetes networking này sẽ giúp bạn hiểu sâu những gì xảy ra đằng sau lệnh kubectl expose, từ đó có thể gỡ lỗi và tối ưu hóa hiệu năng ứng dụng.
Sau một tuần học, tôi có thể thuộc lòng sơ đồ kiến trúc Kubernetes, nhưng phải trải qua sự cố sản xuất thực tế tôi mới thực sự hiểu ý nghĩa của nó.
Lập trình viên nên đọc bài này vì chỉ biết hiểu lý thuyết về Kubernetes là như đọc một bản đồ xe hơi mà chưa từng lái xe thực tế—hàng loạt tình huống sản xuất thực tế sẽ lộ ra những lỗ hổng khi chỉ biết nhớ chứ không biết tìm hiểu bản chất của nó.
Read the news here, practice coding, follow structured courses and train for IELTS on our sibling products — all connected through one 8 Sync account.
The ecosystem home: product overviews, blog and full pricing.
ExploreLearn along a clear roadmap: videos, auto-graded quizzes, certificates and mentors who ship for a living.
View the roadmap1,000+ DSA problems in Vietnamese, auto-graded across 7 languages — many FREE, right in your browser.
Practice for freeAI grading for all four IELTS skills with detailed rubric feedback.
Try it freeA 22 MB AI IDE for Vietnamese devs.
Download freeOrganizational memory for AI agents.
ExploreAI that staffs your Fanpage and qualifies leads for you.
Try it