Maximize Apache Spark availability with flexible VMs
Configure flexible VMs on Managed Service for Apache Spark to prevent compute stockouts, optimize resource allocation, and protect pipeline SLAs.
Tin lập trình mới nhất về apache-spark, tóm tắt tiếng Việt bằng AI.
Configure flexible VMs on Managed Service for Apache Spark to prevent compute stockouts, optimize resource allocation, and protect pipeline SLAs.
Apache Iceberg 1.12 giới thiệu tính năng types địa lý và Variant shredding, cùng với khả năng encryption mới. Phiên bản Iceberg Rust 0.11 đã triển khai sẵn cơ sở hạ tầng cho phiên bản V4. Sự thay đổi đáng chú ý nhất là việc loại bỏ một số API cũ trong bản release này. Nếu bạn làm việc với big data hoặc xây dựng hệ thống phân tích, các cải tiến này sẽ giúp tối ưu hiệu suất và bảo mật dữ liệu.
Apache Iceberg 1.12 và Rust 0.11 mang đến nhiều cải tiến quan trọng về kiểu dữ liệu địa không gian, mã hóa và nền tảng V4 giúp bạn tối ưu hóa hệ thống dữ liệu hiệu quả hơn.
SBOM vs. Reachability in a Custom Spark Image Background If you use Vanilla Spark out of the box, it only gives you the core engine. It misses support for every storage format, cloud provider, or …
What Apache Iceberg snapshot expiration actually deletes, the properties that control it, how to run it on Spark, and the mistakes that cost you rollback.
Bài viết đề cập dự án Lakesail nhằm xây dựng lại Apache Spark bằng Rust. Trang web hiện chỉ chứa các đường dẫn điều hướng và lưu trữ, không có nội dung cụ thể về dự án. Không có thông tin chi tiết về tiến trình phát triển hay tính năng của Lakesail. Các lập trình viên quan tâm nên chờ đợi thông tin chính thức hoặc tìm hiểu các dự án tương tự khác trong hệ sinh thái Rust như Polars.
Bài này cung cấp thông tin về dự án Lakesail tái xây dựng Apache Spark bằng Rust cho các lập trình viên quan tâm đến công nghệ hiệu suất cao.
Developers love Redis. Unlock the full potential of the Redis database with Redis Enterprise and start building blazing fast apps.
Bài viết của Jonathan Saring trên ITNEXT giải thích bối cảnh tại sao việc thực hiện compaction trong Apache Iceberg trở nên cần thiết khi dữ liệu được ghi liên tục sinh ra nhiều file nhỏ. Nó chỉ ra nguyên nhân kỹ thuật là sự tăng trưởng không kiểm soát của manifest và các data files khiến quá trình planning query phải duyệt qua nhiều metadata, tăng overhead. Hệ quả trực tiếp là giảm throughput truy vấn và tăng chi phí lưu trữ vì hệ thống phải đọc và xử lý thêm lượng dữ liệu không cần thiết. Bài viết khuyên nên áp dụng chiến lược compaction dựa trên kích thước file và tần suất commit để giữ số lượng file trong mức hợp lý. Tuy nhiên, tác giả không cung cấp con số đo lường cụ thể về mức độ cải thiện hiệu suất hoặc giảm chi phí sau khi áp dụng các phương pháp này.
Bài viết này cung cấp hướng dẫn thực tế tối ưu hóa hiệu suất Apache Iceberg thông qua chiến lược compaction hiệu quả.
Learn how Yahoo uses flexible VMs in Managed Service for Apache Spark to automatically handle capacity limits and reduce provisioning failures by 85%.
Why the standard groupBy function isn’t enough
Databricks brings declarative ETL to the SQL Editor with APPEND, AUTO CDC, and REPLACE WHERE flows in Lakehouswe.
Delta Lake 4.4.0 mở rộng kiến trúc bảng được quản lý bởi catalog với các cải tiến trên Delta Spark, Kernel, UniForm, Sharing và Flink. Delta Spark chuyển mặc định sang Apache Spark 4.2 (vẫn hỗ trợ 4.1.0 và 4.0.1) và bổ sung cột identity/generated trong SQL DDL, hỗ trợ SHOW PARTITIONS và giữ nguyên cột VOID. Khi kết hợp với Unity Catalog 0.6.0, người dùng có thể tạo các view số liệu được quản lý trên các bảng Delta được catalog quản lý, nâng cao khả năng kiểm soát và truy cập dữ liệu. Delta UniForm cho phép khởi tạo metadata Iceberg nguyên tử khi tạo bảng, nhưng mô-đun delta‑iceberg_2.13 chỉ hỗ trợ Spark 4.1, chưa hỗ trợ Spark 4.2, do đó cần lưu ý sự không tương thích khi sử dụng Spark 4.2. Delta Flink cung cấp các artifact riêng cho Flink 2.0.2‑2.3.0, hỗ trợ upsert khóa chính qua merge‑on‑read và deletion vectors, đọc changelog có khóa từ Kafka (ví dụ RedPanda) và tích hợp UC Delta API, mở rộng khả năng xử lý streaming có giao thức nhất quán.
Để nắm bắt các cải tiến mới trong Delta Lake 4.4 — như tích hợp Spark 4.2, UniForm, API UC Delta và các tính năng quản lý bảng nâng cao — giúp tối ưu hoá hiệu suất và tính bảo mật trong môi trường lakehouse
Customers can now connect local IDEs to Databricks to interactively run workloads and edit workspace files. We’re also sharing the latest updates to the Databricks IDE Extension.
This article covers the three migration strategies and how to execute a zero-downtime migration using the view swap pattern.
Bài viết giải thích tại sao việc duy trì bảng Apache Iceberg là cần thiết để tránh suy giảm hiệu suất và lãng phí lưu trữ khi dữ liệu tăng trưởng. Nguyên nhân kỹ thuật chủ yếu là sự tích tụ của nhiều file Parquet nhỏ, các snapshot cũ không được xoá và metadata JSON lớn lên do mỗi lần ghi tạo ra bản ghi mới. Hệ quả là thời gian truy vấn tăng vì planner phải quét nhiều file hơn, đồng thời dung lượng storage tăng đáng kể do các file mồ côi (orphan files) và metadata dư thừa. Bài hướng dẫn cụ thể các quy trình bảo trì như gọi CALL system.rewrite_data_files để nén file nhỏ, CALL system.expire_snapshots để xoá snapshot cũ (mặc định giữ 5 ngày) và CALL system.remove_orphan_files để dọn dong file không còn được tham chiếu. Điều đáng học là nên lên lịch chạy các thủ tục này định kỳ, theo dõi kích thước metadata và số lượng file qua bảng hệ thống iceberg.snapshots và để cân bằng giữa chi phí lưu trữ và hiệu suất truy vấn.
AWS Glue 6.0 vừa được ra mắt chung với mức giá giảm 30% so với phiên bản trước và hỗ trợ đầy đủ Apache Iceberg v3 (phiên bản Iceberg 1.11.0). Bản bản được xây trên Spark 4.1, Python 3.12, Scala 2.13, giới thiệu kiểu dữ liệu VARIANT với shredding để truy vấn dữ liệu bán cấu trúc mà không cần làm phẳng schema, cùng với kiểu geometry/geography, timestamp nanosecond và xử lý unknown type. Ngoài ra, Glue 6.0 cung cấp Spark declarative pipelines, Arrow-native Python UDF/UDTF và chế độ streaming real-time với độ trễ một chữ số mili giây, tất cả này không thay đổi API; công việc hiện có chỉ cần chọn --glue-version 6.0 hoặc được tự động nâng cấp bằng Spark upgrade agent. Việc giảm giá đồng thời nâng cấp stack và tích hợp tính năng Iceberg v3 cho thấy AWS đang ưu tiên hiệu suất chi phí và khả năng làm việc với dữ liệu phân tích hiện đại, điều mà các nhóm dữ liệu nên cân nhắc khi lên kế hoạch nâng cấp ETL.
Bài viết này giúp lập trình viên tiết kiệm 30% chi phí và tận dụng công nghệ dữ liệu hiện đại nhất với AWS Glue 6.0.
AWS Glue 6.0 là phiên bản mới nhất của dịch vụ ETL quản lý hoàn toàn trên AWS, ra mắt với mục tiêu giảm chi phí và mở rộng khả năng làm việc với bảng dữ liệu hiện đại. Bản cập nhật này giảm giá sử dụng lên tới 30% nhờ tối ưu hóa mức tiêu thụ DPU và cải thiện thuật toán lập lịch job. Đồng thời, Glue 6.0 thêm hỗ trợ đầy đủ cho Apache Iceberg phiên bản 3, cho phép người dùng khai thác tính năng ẩn phân vùng, évolution schema và time‑travel mà không cần quản lý catalog riêng. Kết quả là các quy trình ETL chạy trên Glue có thể tiết kiệm đáng kể về chi phí vận hành đồng thờiGain được linh hoạt hơn trong việc lưu trữ và truy vấn dữ liệu lớn trên S3. Đối với lập trình viên đang cân nhắc đọc bài gốc, thông tin về mức giảm giá cụ thể và phiên bản Iceberg được hỗ trợ là yếu tố then chốt để đánh giá giá trị nâng cấp hoặc chuyển đổi sang Glue 6.0.
Bài viết này giúp lập trình viên tiết kiệm chi phí 30% khi sử dụng AWS Glue 6.0 và tận dụng tính năng hỗ trợ Iceberg v3 cho hệ thống dữ liệu hiệu quả hơn.
Learn to choose Apache Spark deployment models, optimize costs, and troubleshoot serverless pipelines on Google Cloud with Gemini Cloud Assist.
Machine learning mod
Unity Catalog 0.5 giới thiệu UC Delta API, một giao diện REST có phiên bản, hướng đến mục đích và nguyên tử cho hệ sinh thái Delta. API này có thể khám phá thông qua endpoint cấu hình, đàm phán phiên bản giao thức và các tính năng bảng bắt buộc, mang theo lược đồ Delta gốc và giao thức qua mạng, đồng thời hỗ trợ quy trình commit được bảo vệ bởi các điều kiện tiên quyết.
Lập trình viên cần đọc bài này để khám phá cách xây dựng ứng dụng tích hợp với Unity Catalog thông qua API Delta, giúp tự động hóa và tối ưu hóa việc xử lý dữ liệu với tính năng versioning, nguyên tử và bảo mật credential ngắn hạn.
Việc streaming data vào Apache Iceberg giải quyết khoảng cách bằng cách commit dữ liệu theo định kỳ, nhưng commit thường xuyên dẫn đến vấn đề small file, buộc phải cân bằng giữa tính tươi mới của dữ liệu và sức khỏe bảng.
Một lập trình viên cần đọc bài này để hiểu cách tối ưu hóa việc lưu trữ dữ liệu поток (streaming) vào Iceberg mà không phải lo lắng về vấn đề small file và cân bằng giữa độ tươi mới của dữ liệu với hiệu suất của bảng dữ liệu.
AUTO CDC nâng cấp khả năng capture dữ liệu thay đổi (CDC) bằng cách bổ sung hỗ trợ Bitemporal, Partial Updates và đóng góp mã nguồn mở cho Apache Spark 4.2, giúp giải quyết các trường hợp sử dụng thực tế khó khăn ở quy mô lớn.
Lập trình viên chuyên nghiệp cần đọc bài này để khám phá cách AUTO CDC mở rộng khả năng xử lý thay đổi dữ liệu phức tạp trong các trường hợp thực tế như cập nhật bán toàn bộ, thời gian sinh tồn (bitemporal) và tích hợp mở rộng với Apache Spark, giúp tối ưu hóa quy trình chuyển đổi và lưu trữ dữ liệu hiệu quả hơn.
WPP đã xây dựng một nền tảng kỹ thuật thống nhất theo hướng tùy chỉnh, chuẩn hóa các mẫu tính toán serverless và quy trình xử lý dữ liệu.
Một lập trình viên chuyên về công nghệ dữ liệu hoặc AI nên đọc bài này để hiểu cách WPP tối ưu hóa quy trình xây dựng nền tảng serverless và xử lý dữ liệu theo tiêu chuẩn hóa, giúp giải quyết những thách thức về hiệu suất và khả năng mở rộng trong việc tích hợp các công cụ AI vào chiến lược marketing.
Spark-Beyond Basics giới thiệu tính năng Row Level Security (RLS) trong Databricks, giúp kiểm soát quyền truy cập dữ liệu theo từng hàng, tương tự như cách quản lý thông tin trong sổ nhật ký xưa.
Lập trình viên cần đọc bài này để khám phá cách bảo vệ dữ liệu ở cấp độ hàng trong Databricks, giúp ứng dụng của họ bảo vệ thông tin nhạy cảm mà không cần phân tích toàn bộ dữ liệu, từ đó nâng cao tính bảo mật và tuân thủ quy định.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
iceberg.filesBài viết này giúp lập trình viên hiểu rõ cách tối ưu hóa hiệu suất và quản lý tài nguyên hiệu quả khi làm việc với Apache Iceberg Tables.