Starting with a local Parquet file, then joining it to data stored in the cloud
Nguồn: https://towardsdatascience.com/building-a-data-lakehouse-with-duckdb-and-ducklake. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
DuckDB Skills for Claude Code bổ sung nhiều khả năng mới cho Claude Code, cho phép sử dụng DuckDB CLI để đọc file dữ liệu, chạy truy vấn và chuyển đổi định dạng. Plugin này hỗ trợ làm việc với spatial data, khám phá object storage, tìm kiếm tài liệu và truy hồi các phiên làm việc trước. Các kỹ năng được triển khai thông qua CLI DuckDB giúp xử lý hiệu quả nhiều loại file dữ liệu khác nhau. Đây là giải pháp hữu ích cho lập trình viên cần xử lý phân tích dữ liệu trực tiếp trong môi trường Claude Code.
Plugin duckdb-skills giúp Claude Code mở rộng khả năng xử lý dữ liệu với nhiều kỹ thuật hữu ích từ DuckDB CLI.
Đang tải bình luận…
DuckDB 2.0 mang lại hiệu suất vượt trội với recursive CTEs nhanh hơn tới 90x so với phiên …
SQLite, Postgres, DuckDB và 20 hệ thống CSDL khác đều thực hiện chức năng write, store và read data. Việc lựa chọn phụ thuộc vào loại truy vấn hàng ngày của bạn - DuckDB xử lý analytical queries nhanh hơn 10-100 lần so với SQLite cho dữ liệu lớn. Postgres tỏ ưu thế với transactional workload nhờ tính ACID và hỗ trợ concurrency tốt hơn. SQLite phù hợp ứng dụng embedded với yêu cầu nhẹ nhàng, trong khi các hệ thống NoSQL như MongoDB excel với dữ liệu không cấu trúc. Bài viết giúp hiểu rõ đặc điểm từng công nghệ để đưa ra lựa chọn tối ưu cho use case cụ thể.
Bài viết giúp lập trình viên hiểu rõ cách chọn phù hợp giữa nhiều hệ thống cơ sở dữ liệu khác nhau dựa trên nhu cầu cụ thể.
Trong bối cảnh ngày càng nhiều công ty sử dụng AI agents, các pipeline dữ liệu cần được quản lý như code. Nguyên nhân kỹ thuật là các agents như Meta đang sử dụng Slack và các công cụ tương tự để tự động hóa việc truy cập dữ liệu, đòi hỏi pipeline phải có tính nhất quán và version control. Hệ quả nếu không làm điều này là việc quản lý dữ liệu trở nên hỗn loạn, giống như việc Meta phải đối mặt khi di chuyển hệ thống. Bài viết đưa ra ví dụ cụ thể về cách xử lý 10,000 bài toán PhD với các công nghệ như DuckDB và MotherDuck để minh họa cho cách tiếp cận hiệu quả. Điều đáng học là áp dụng nguyên tắc "data pipelines as code" để đảm bảo tính reproduceable và maintainable trong thời đại AI bùng nổ.
Bài viết giúp bạn hiểu tại sao cần quản lý data pipelines như code để tối ưu hóa hiệu suất và dễ bảo trì.
Polars là thư viện DataFrame viết bằng Rust có API Python, và bản pre‑release 2.0 đang được công bố. Phiên bản này tích hợp streaming engine vào mọi truy vấn lazy, cho phép thực hiện xử lý luồng thay vì tải toàn bộ dữ liệu vào bộ nhớ. Với streaming engine, các truy vấn lazy có thể làm việc trên tập dữ liệu lớn hơn RAM mà mức tiêu thụ bộ nhớ gần như không đổi, đồng thời giảm thời gian thực hiện do tránh việc sao chép dữ liệu trung gian. Việc đưa streaming engine vào mô hình lazy cho thấy cách mở rộng khả năng xử lý dữ liệu lớn mà không cần thay đổi API hiện tại, nên các nhà phát triển cân nhắc nâng cấp để xử lý workload out‑of‑core. Bản pre‑release vẫn có thể thay đổi, vì vậy trước khi áp dụng trong sản phẩm nên kiểm tra tính ổn định và benchmark trên dữ liệu thực tế.
Polars 2.0 giới thiệu công cụ streaming cho tất cả các truy vấn lazy, giúp xử lý dữ liệu lớn hiệu quả hơn.
DuckDB phiên bản 2.0 dự kiến ra mắt vào mùa thu năm nay với nhiều tính năng mới nổi bật như hỗ trợ chạy dưới dạng server, triggers, kiểu dữ liệu VARIANT, I/O bất đồng bộ, SQL parser mới, định dạng lưu trữ cải tiến cùng nhiều cải tiến khác.
Lập trình viên cần đọc bài này để khám phá cách DuckDB v2.0 nâng cấp hiệu suất và tính linh hoạt cho các ứng dụng xử lý dữ liệu, từ việc chạy như một server đến hỗ trợ các tính năng mới như biến đổi dữ liệu trong SQL và lưu trữ hiệu quả hơn.
Bài viết đánh giá lại những lời khuyên trước đây về các tính năng như COPY, TOAST, BRIN, covering indexes và partitioning trong PostgreSQL, xem xét những thay đổi từ các phiên bản Postgres gần đây và đưa ra khuyến nghị cho phiên bản sắp tới (Postgres 19).
Một lập trình viên nên đọc bài này để cập nhật cách tối ưu hóa cơ sở dữ liệu PostgreSQL 19 mới nhất, đặc biệt là về các kỹ thuật như COPY, TOAST, BRIN, và cách sử dụng các chỉ mục bù và phân vùng hiệu quả, giúp cải thiện hiệu suất và quản lý tài nguyên trong ứng dụng hiện đại.
Khi người dùng bắt đầu tải lên file vượt 5GB qua tính năng đính kèm trong Slack, máy chủ Node.js đang dùng middleware body‑parser mặc định cố gắng đọc toàn bộ payload vào RAM, khiến bộ nhớ tăng đột ngột và process bị kill khi vượt quá giới hạn heap. Nguyên nhân kỹ thuật là việc không sử dụng streaming parser, vì mỗi kết nối tiêu tốn khoảng 5–6 GB RAM trong thời gian xử lý upload, làm giảm khả năng xử lý song song và gây ra timeout cho các request khác. Hệ quả là server thường xuyên restart, perda dữ liệu upload chưa hoàn thành và thời gian phản hồi tăng lên tới 30 giây cho các truy vấn API bình thường. Để khắc phục, tác giả đã thay body‑parser bằng busboy (hoặc multiparty) và pipe dữ liệu trực tiếp vào một file tạm trên đĩa hoặc vào multipart upload của Amazon S3, đồng thời đặt giới hạn kích thước phần qua highWaterMark và bật chế độ tự động dọn dẹp file tạm sau khi hoàn thành. Bài học là đối với file lớn hơn vài trăm MB, Node.js không nên đọc toàn bộ payload vào bộ nhớ; thay vào đó, cần sử dụng streaming, lưu trữ tạm hoặc truyền trực tiếp tới dịch vụ lưu trữ đối tượng, và nếu cần xử lý sau upload thì offload sang worker thread hoặc dịch vụ nền.
Bài này sẽ dạy bạn cách xử lý upload file lớn trên Node.js mà không làm quá tải server.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử