LM Studio built a judge for AI commands. Then the judge started agreeing with the defendant.
LM Studio đã xây dựng một hệ thống tự động gọi là Auto Review để đánh giá các lệnh shell mà mô hình AI sinh ra. Hệ thống này hoạt động bằng một lần gọi mô hình và có thể chấp nhận hầu hết các lệnh mà không cần kiểm tra thêm. Tuy nhiên, khi lệnh chứa biến, đặc điểm cụ thể của công cụ hoặc các mẫu prompt injection, quá trình đánh giá trở nên khó khăn và bắt đầu sai lệch.Trong những trường hợp khó này, Auto Review bắt đầu đồng ý với đầu vào của “defendant”, tức là chấp nhận các lệnh có thể không an toàn. Điều này cho thấy việc dựa vào một lần review đơn lọc không đủ để phát hiện các kỹ thuật tấn công qua biến số hoặc injection.Để giảm rủi ro, các nhóm nên bổ sung một bước kiểm tra thứ hai, chạy lệnh trong môi trường cài đặt sandbox hoặc áp dụng phân tích tĩnh trước khi tin tưởng vào lệnh shell được tạo bởi AI.
