
Agent memory differs fundamentally from RAG: the corpus is personal and dynamic, queries are autobiographical, and time is a first-class dimension. This post details an evaluation framework using two benchmarks — LoCoMo (10 long naturalistic conversations, 1,540 questions) and LongMemEval (500 questions in session haystacks at two scales: ~46 sessions vs. ~500 sessions). Key findings include that optimal retrieval depth (k) and prompt variants differ significantly between the small and large scale variants, making LME-S an insufficient proxy for production. Three metrics are used: BLEU, F1, and an LLM Judge score — with the judge prompt itself shown to dramatically shift results. The ingestion pipeline uses dual point-of-view extraction, async LLM context extraction (~3.6s), and stores raw text, summaries, and discrete fact strings in Couchbase with human-readable timestamps. Embedding-based vector search returns in ~298ms p50, with the embedding step as the bottleneck rather than Couchbase retrieval.
Nguồn: https://www.couchbase.com/blog/what-we-learned-evaluating-agent-memorythe-setup-part-1. 8sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Ba nền tảng giao đồ ăn DoorDash, Instacart và Uber Eats đều tích hợp mô hình ngôn ngữ lớn (LLM) vào chức năng tìm kiếm, nhưng theo ba cách khác biệt về mặt kỹ thuật và trải nghiệm người dùng.
Lập trình viên nên đọc bài này để hiểu cách các nền tảng delivery sử dụng mô hình ngôn ngữ lớn (LLM) để tối ưu hóa giao diện tìm kiếm, từ đó học cách áp dụng các giải pháp riêng biệt nhưng hiệu quả trong việc xây dựng ứng dụng tương tác AI cho các dự án của riêng mình.
Kimi Linear là kiến trúc chú ý (attention) mới được đề xuất trong bài báo arXiv 2510.26692, nhằm cải thiện khả năng biểu đạt (expressive) và hiệu quả (efficient) so với các mô hình chú ý truyền thống.
Lập trình viên muốn tối ưu hóa hiệu suất AI/ML cho ứng dụng của mình nên đọc bài vì nó giới thiệu một kiến trúc chú ý (attention) hiệu quả hơn, giúp giảm chi phí tính toán và tăng hiệu suất mô hình mà vẫn giữ được độ biểu đạt cao.
Mô hình đa phương thức Kimi K3 của Moonshot, với 2,8 nghìn tỷ tham số, cùng công cụ DFlash speculator tùy chỉnh, đã được triển khai trên nền tảng Modal.
Là người phát triển muốn tối ưu hóa hiệu suất và tính năng AI cho ứng dụng của mình, bạn nên đọc bài này để hiểu cách Kimi K3 và DFlash Speculator của Moonshot có thể giúp cải thiện hiệu năng xử lý đa modal và dự đoán trong các ứng dụng AI hiện đại.
Dario Amodei, CEO của Anthropic, đã chia sẻ quan điểm của công ty về các mô hình open-weights (mô hình có trọng số mở).
Lập trình viên nên đọc bài này để hiểu cách các mô hình AI lớn như OpenAI đang cân bằng giữa công khai và bảo mật trong phát triển công nghệ, giúp họ tìm hiểu xu hướng mới về quyền sở hữu dữ liệu và ứng dụng thực tế trong tương lai.
Dario Amodei, CEO của Anthropic, cho biết công ty không ủng hộ lệnh cấm các mô hình AI "open-weight" nhưng đề xuất kiểm soát xuất khẩu chip, hạn chế kỹ thuật "distillation" và bắt buộc kiểm tra an toàn bắt buộc.
Lập trình viên nên đọc bài này để hiểu cách các công ty AI lớn như Anthropic định hình chính sách công khai hóa mô hình, ảnh hưởng đến tương lai phát triển công nghệ mở và an toàn của AI trong ngành.
Mới đây, Moonshot AI đã ra mắt phiên bản mới nhất của mô hình ngôn ngữ Kimi-K3.
Lập trình viên nên đọc bài này để khám phá cách Moonshot AI áp dụng kiến thức AI tiên tiến vào các ứng dụng thực tế, giúp phát triển công cụ tự động hóa, tối ưu hóa dữ liệu và tích hợp AI vào các dự án phần mềm của riêng mình hiệu quả hơn.
Anthropic đề xuất áp dụng các bài kiểm tra (tests) thay vì lệnh cấm (bans) đối với mô hình AI, trong khi OpenAI và Google ủng hộ việc mở trọng số (open weights). Đề xuất của Dario Amodei miễn trừ cho các startup và học viện, nhưng chưa xác định ngưỡng năng lực (capability threshold) cụ thể.
Lập trình viên nên đọc bài này để hiểu cách các công ty lớn như OpenAI và Google đang định hình những quy tắc mới về việc sử dụng mô hình AI công khai, đặc biệt là cách họ phân biệt giữa các tổ chức nhỏ và lớn, ảnh hưởng trực tiếp đến khả năng phát triển công nghệ AI của cộng đồng.
Microsoft tuyên bố các mô hình AI tự phát triển của họ đạt hiệu suất tương đương với đối thủ trên các tác vụ Excel và lập trình, vừa giảm chi phí vừa tận dụng dữ liệu doanh nghiệp khổng lồ để nâng cao sản phẩm.
Những thông tin về Microsoft tích hợp AI nội bộ như thế nào sẽ giúp bạn hiểu rõ hơn về cách công nghệ AI được ứng dụng trong doanh nghiệp để tiết kiệm chi phí và nâng cao hiệu suất, đặc biệt là trong lĩnh vực xử lý dữ liệu và lập trình.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync Dev.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử