Designing a Production-Ready Agent Harness With Persistence and Checkpointing
Để xây dựng một agent harness có khả năng chịu được crash và restart, tác giả đề xuất mô hình mỗi lần chạy agent như state bền vững với id, cursor và version, lưu trữ trong SQLite (hoặc Postgres cho đa tiến trình). Hệ thống checkpoint trước và sau các bước có side effect, sử dụng compare-and-swap dựa trên version để ngăn chèn chéo giữa các worker đồng thời. Các tool call được bảo vệ chống retry bằng idempotency key được sinh từ run_id và step index, với fallback dedup table cho dịch vụ không hỗ trợ idempotency. Bài viết bao gồm code Python hoàn chỉnh, test crash-and-recovery thực tế, và khuyến cáo theo dõi các bước ở trạng thái RUNNING sau recovery và cảnh báo nếu bước đó vượt TTL.
Lập trình viên nên đọc bài này để học cách xây dựng hệ thống agent bền vững, xử lý lỗi hiệu quả và quản lý trạng thái trong môi trường phân tán.




