Claude Fable 5, Anthropic's most powerful model, has been relaunched for all users after a government-imposed ban was lifted, but the reception has been disappointing. Users report that the restored model frequently falls back to Opus 4.8 due to overly aggressive safety guardrails, even for benign tasks like searching for dead code or working with C/C++/Rust. Triggers appear to include security-adjacent language in prompts or project files. Anthropic has not nerfed the model itself, but its updated safety systems use a large 'safety margin' that causes excessive false positives. Additionally, Fable 5 usage is capped at 50% of weekly limits on subscription plans, with a full transition to pay-per-use credits expected after July 7.
Nguồn: https://www.bleepingcomputer.com/news/artificial-intelligence/claude-fable-relaunch-disappoints-users-with-nerfed-performance. 8sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Bài viết hướng dẫn từng bước triển khai mô hình LLM-as-a-Judge trong Spring AI bằng cách sử dụng recursive advisors, nơi LLM thứ hai đánh giá và cho điểm phản hồi của LLM sinh ra dựa trên tiêu chí rubric, sau đó phản hồi phê bình được đưa trở lại prompt để tinh chỉnh. Quá trình lặp lại cho đến khi đạt ngưỡng chất lượng hoặc giới hạn số lần thử tối đa.
Làm việc với LLM-as-a-Judge trong Spring AI giúp tối ưu hóa chất lượng phản hồi của AI bằng cách kết hợp đánh giá tự động và phản hồi lặp đi lặp lại, giảm thiểu sai sót và tăng hiệu suất cho các ứng dụng tự động hóa.
Bài viết chỉ trích "AI Confidence Theater" – xu hướng thổi phồng khả năng và quy trình AI trên mạng xã hội lẫn trong doanh nghiệp, gây hại bằng cách bóp méo kỳ vọng, tạo FOMO, khó khăn trong tuyển dụng và áp lực giả vờ thành thạo AI. Tác giả đề xuất thay đổi bằng cách chia sẻ kết quả thực tế, thừa nhận giới hạn và tập trung vào công việc duy trì hệ thống AI vốn ít hào nhoáng nhưng mang lại giá trị thực.
Nếu bạn đang tìm hiểu về cách xây dựng dự án AI thực tế và tránh bị lừa bởi hype không có cơ sở, bài viết này giúp bạn phân biệt giữa tuyên bố hype và kiến thức thực sự để đưa ra quyết định sáng suốt về việc đầu tư thời gian và nguồn lực.
Armin Ronacher phát hiện lỗi trong các mẫu Claude mới (Opus 4.8, Sonnet 5) khi chúng tự động thêm các key không xác định vào arguments của tool call, khiến tool chỉnh sửa (Pi's edit tool) từ chối. Lỗi này xảy ra chủ yếu trong các phiên agent dài, do post-training trên Claude Code's forgiving harness đã giảm khả năng tuân thủ schema. Bật chế độ strict mode của Anthropic sẽ khắc phục vấn đề, nhưng lo ngại lớn hơn là sự phụ thuộc vào harness độc quyền có thể khiến các schema khác trở nên "out-of-distribution".
Là lập trình viên phát triển hệ thống AI tích hợp công cụ, bạn cần hiểu cách các mô hình mới có thể bị ảnh hưởng bởi các lỗi schema trong gọi API, khiến các công cụ như Pi bị từ chối và làm giảm hiệu quả của ứng dụng của bạn.
Một nhà phát triển xây dựng pipeline RAG cho trợ lý di trú chia sẻ lý do không dùng LangChain trong sản xuất vì các lớp trừu tượng của nó che giấu những quyết định quan trọng về chunking, chất lượng truy xuất và cấu trúc tài liệu. Việc xây dựng từ đầu với ChromaDB, pdfplumber và Groq API giúp kiểm soát toàn bộ code, dễ dàng gỡ lỗi và đưa ra quyết định thiết kế có ý nghĩa. LangChain vẫn phù hợp để tạo nguyên mẫu, nhưng tác giả khuyên nên tự xây dựng ít nhất một lần để hiểu những gì framework đang trừu tượng hóa.
Lập trình viên nên đọc bài này để hiểu cách LangChain có thể làm giảm bớt trách nhiệm thiết kế chi tiết trong pipeline AI như xử lý đoạn văn, tìm kiếm dữ liệu và cấu trúc tài liệu, nhưng khi chuyển sang sản phẩm thực tế, sự kiểm soát trực tiếp từ code gốc sẽ giúp tránh những lỗi khó debug và tối ưu hóa hiệu suất.
Một thí nghiệm chéo giữa ChatGPT, Grok, Gemini và Claude nhằm kiểm chứng các tuyên bố về hành vi AI thay vì thống nhất quan điểm, cho thấy sự đồng thuận giữa các mô hình cùng lỗi không chứng minh được gì, mà sự khác biệt giữa chúng mới là tín hiệu quan trọng. Nghiên cứu phát hiện ChatGPT có khả năng ghi nhớ dai dẫn đến phụ thuộc, trong khi Claude lại thể hiện xu hướng ngược lại (phản ứng tiêu cực thay vì tâng bốc), đồng thời nhấn mạnh cách đặt câu hỏi ảnh hưởng đến phản hồi của mô hình. Phương pháp đề xuất là chuyển yêu cầu đến phiên bản mới, không có ngữ cảnh và coi sự khác biệt là tín hiệu đánh giá trung thực.
Những lập trình viên muốn xây dựng hệ thống AI đáng tin cậy phải hiểu cách phân biệt sự đồng thuận giả mạo với những khác biệt thực sự từ các mô hình khác nhau để tránh rơi vào nhầm lẫn về tính toàn vẹn và tính độc lập của AI trong ứng dụng thực tế.
AI chuyên biệt không phải là lựa chọn mà là xu hướng tất yếu do ba nguyên lý: định lý No …
Việc sử dụng thư viện open source trở nên tốn kém hơn do chi phí duy trì, kiểm toán và phụ thuộc, trong khi LLMs giúp viết code rẻ hơn đáng kể. Giờ đây, chỉ nên dùng thư viện cho các lĩnh vực nhạy cảm bảo mật hoặc phức tạp, còn code đơn giản nên tự phát triển với sự hỗ trợ của LLM.
Làm việc với các dự án nhỏ hoặc logic đơn giản, hiểu cách tối ưu hóa giữa sử dụng thư viện mở nguồn và viết lại từ đầu sẽ giúp bạn tiết kiệm thời gian và tránh rủi ro khi phụ thuộc vào các công cụ lớn mà không kiểm soát được.
Claude Code có thể thay thế toàn bộ bộ công cụ năng suất cho người dùng không chuyên bằng cách truy cập vào thư mục chứa file văn bản thuần túy và Markdown. Với file CLAUDE.md hướng dẫn, nó quản lý ghi chú, tác vụ, bảng biểu và hệ thống lưu bài đọc sau, thay thế các công cụ trả phí như Notion, Instapaper hay Readwise Reader. Tác giả chia sẻ cách thiết lập thư mục con cho ghi chú/tác vụ, hệ thống queue.md cho bài đọc sau với thẻ inline và tóm tắt do AI tạo, đồng thời tận dụng khả năng đọc file của Claude để tham chiếu chéo giữa các thư mục.
Lập trình viên nên đọc bài này để khám phá cách sử dụng AI như Claude Code để tự động hóa quản lý công việc, notes và lưu trữ thông tin một cách hiệu quả, thay thế nhiều công cụ chuyên dụng mà không cần phụ thuộc vào các nền tảng ngoài.