Movie Finder is a demo application built on MyVector, a vector-search component for MySQL, letting users semantically search up to 1,035,695 TMDB movies by describing them in natural language and getting results in milliseconds. It runs entirely inside MySQL 9.7 with no separate vector database, using HNSW indexing declared via a column comment and queried with functions like myvector_ann_set() and myvector_distance(). The demo shows filtering combined with vector search, 'more like this' queries using stored vectors, live index status, and speed-vs-recall comparisons between HNSW and exact scans. Benchmarks on a 16-core Arm host show HNSW search at 5-20ms versus 3 seconds for exact scan at full scale, with 100% recall@10 unfiltered. The app can be run locally via docker compose, with a live hosted demo also available.
Nguồn: https://askdba.net/movie-finder-semantic-search-over-1m-films-inside-mysql. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
create-cosmos-agent là một CLI viết bằng TypeScript giúp xây dựng AI agent production-ready nhanh chóng hơn. Công cụ này tích hợp sẵn memory, isolation, testing và hỗ trợ Azure Cosmos DB để lưu trữ dữ liệu. Nguyên nhân kỹ thuật là cần giải pháp đơn giản hóa quy trình phát triển agent phức tạp, vốn thường đòi hỏi nhiều thư viện và cấu hình riêng lẻ. Hệ quả là lập trình viên có thể bắt đầu từ một thư mục trống và triển khai agent có khả năng lưu trạng thái và xử lý tác vụ ngay lập tức. Điểm đáng học là cách tiếp cận modular và độc lập của create-cosmos-agent giúp tách biệt phần logic agent khỏi cơ sở dữ liệu và cơ chế lưu trữ.
create-cosmos-agent giúp bạn xây dựng AI agent sản xuất nhanh chóng với tính năng memory, isolation, testing và tích hợp Azure Cosmos DB.
Agentforce Memory cung cấp giải pháp lưu trữ bền vững cho AI agents, giải quyết vấn đề trí tuệ nhân tạo thiếu bộ nhớ dài hạn. Công nghệ sử dụng semantic retrieval để tổ chức thông tin, kết hợp với bounded context để giới hạn không gian xử lý và pre-orchestration để chuẩn bị trước quy trình. Hệ quả giúp agents duy trì ngữ cảnh qua nhiều phiên tương tác mà không ảnh hưởng đến trust score hay hiệu năng. Quan trọng hơn, giải pháp này cho phép agents học từ trải nghiệm trước đó như con người thực sự.
Bài này giúp lập trình viên hiểu cách xây dựng bộ nhớ bền vững cho AI Agentforce mà không làm giảm độ tin cậy.
Bối cảnh bài viết khám phá hiện tượng cùng một token (như "light") trong language model mang nghĩa khác nhau tùy theo ngữ cảnh. Nguyên nhân kỹ thuật nằm ở cơ chế attention trong transformer architecture giúp model phân biệt các nghĩa của token dựa trên context window xung quanh. Hệ quả là các Large Language Model có khả năng hiểu ngữ cảnh đa chiều, tạo ra output chính xác hơn thay vì xử lý token một cách độc lập. Đáng học hỏi là việc nghiên cứu cách AI hệ thống hóa các mối quan hệ ngữ cảnh này có thể mở đường cho các ứng dụng hiểu ngôn ngữ tự nhiên sâu hơn, như thấy trong các model như GPT-4 và Claude 3.
Bài giải thích cách ngữ cảnh biến đổi cách biểu diễn token và ứng dụng trong các hệ thống AI giúp lập trình viên hiểu sâu hơn về cơ chế xử lý ngôn ngữ tự nhiên.
Bối cảnh: AI tutor đã phát triển qua 4 tháng với kiến trúc dựa trên agents, embeddings, cơ chế human-in-the-loop và quản lý chi phí. Nguyên nhân kỹ thuật: Hệ thống sử dụng vector embeddings để xử lý ngôn ngữ tự nhiên, kết hợp với agents để thực hiện các tác vụ giáo dục, và cơ chế human-in-the-loop để điều chỉnh khi cần thiết. Hệ quả: Kiến trúc này giúp giảm 30% chi phí xử lý so với hệ thống trước đây, đồng thời cải thiện 25% độ chính xác trong phản hồi học tập. Điều đáng học: Quản lý cost hiệu quả là yếu tố sống còn khi triển khai AI ở quy mô lớn, cần cân bằng giữa tự động hóa và can thiệp của con người.
Bài viết này giúp lập trình viên hiểu rõ kiến trúc thực tế đằng sau một sản phẩm AI cốt lõi với các thành phần Agents, embeddings và human-in-the-loop.
Bối cảnh: Quản lý dataset lớn và phát triển nhanh chóng là kỹ năng quan trọng cho lập trình viên hiện đại, từ theo dõi log API, giám sát telemetry IoT đến xây dựng dashboard. Nguyên nhân kỹ thuật: Các giải pháp truyền thống như PostgreSQL gặp khó khăn với hiệu suất khi xử lý time-series data, dẫn đến TimescaleDB ra đời như extension PostgreSQL chuyên dụng. Hệ quả: TimescaleDB cho phép xử lý hàng tỷ điểm dữ liệu mỗi ngày với hiệu suất cao hơn 20 lần so với PostgreSQL thông thường, hỗ trợ time-range queries và continuous aggregates. Điều đáng học: Khóa học này sẽ trang bị kiến thức về hypertables, compression policies và API-specific optimizations cho use cases thực tế như IoT monitoring và analytics.
TimescaleDB cung cấp giải pháp tối ưu để xử lý hiệu quả dữ liệu chuỗi thời gian lớn với tốc độ cao.
EF Core 10 giới thiệu các toán tử LeftJoin và RightJoin cấp first-class, cùng với named query filters có thể tắt riêng lẻ. Bản cập nhật này hỗ trợ complex types được ánh xạ trực tiếp vào JSON columns, cải thiện hiệu suất truy vấn. Các tính năng mới giúp giảm thiểu lượng code cần viết khi xử lý các thao tác join và lọc phức tạp. Với khả năng ánh xạ trực tiếp đến JSON columns, EF Core 10 mang lại giải pháp linh hoạt hơn cho việc làm việc với dữ liệu không quan hệ. Những cải tiến này đặc biệt hữu ích cho các ứng dụng cần xử lý cả cấu trúc quan hệ và phi quan hệ.
EF Core 10 mang đến những tính năng đột phá như LeftJoin, RightJoin và bộ lọc truy vấn có thể tắt riêng lẻ, giúp tối ưu hiệu suất và khả năng linh hoạt trong phát triển ứng dụng.
Data API builder phiên bản 2.1.5 vừa bổ sung hỗ trợ cho các kiểu dữ liệu JSON và vector trong REST và GraphQL API. Bản cập nhật này tích hợp thêm thư viện NuGet để dễ dàng tích hợp vào hệ thống .NET hiện có, đồng thời tăng cường bảo mật cho endpoint MCP. Phiên bản mới này cũng hỗ trợ .NET 10, mang lại hiệu năng tốt hơn và tương thích với công nghệ mới nhất. Với việc hỗ trợ vector data type, Data API builder giờ đây phù hợp hơn cho các ứng dụng AI và machine learning đòi hỏi xử lý dữ liệu đa chiều.
Lập trình viên nên đọc bài này để cập nhật về hỗ trợ JSON và vector mới trong Data API builder 2.1.5.
Trên instance GCP c4d-standard-4, tiến trình MySQL tiêu tốn 10.4 GB RAM dù innodb_buffer_pool_size chỉ được thiết lập là 7168 MB. Khoảng trống này được truy qua 4 lớp: dự kiến overhead từ InnoDB/Performance Schema/thread-buffer, khoảng ~9% mmap chunk padding trên buffer pool, sự tích tụ dirty pages của jemalloc trên DR replica không hoạt động, và nguyên nhân gốc - MALLOC_CONF không được thiết lập khiến decay của background_thread bị vô hiệu hóa. Các sửa chữa gồm giảm buffer pool thành bội số sạch (6144 MB), cắt giảm max_connections từ 3000 xuống 500, bật background_thread của jemalloc với decay 5 giây, và thêm swap để phòng OOM, giúp giảm RSS xuống còn ~7.9 GB. Bài viết cung cấp kiến thức sâu về quản lý memory của MySQL khi sử dụng jemalloc, cách tối ưu buffer pool size và thiết lập MALLOC_CONF phù hợp.
Lập trình viên cần đọc bài này để hiểu cách điều khiển và tối ưu hóa bộ nhớ InnoDB trên MySQL khi các tham số cơ bản như innodb_buffer_pool_size không đủ để giải quyết cảnh báo nhớ, khi hệ thống vẫn tiêu thụ nhiều bộ nhớ hơn dự kiến do các yếu tố như cấu hình bộ nhớ phân vùng, quá trình làm sạch nhớ của jemalloc, hoặc tình trạng replica hoạt động không hiệu quả.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử