Đối mặt với khối lượng 8 triệu job mỗi ngày, team Spark đã triển khai execution telemetry để giám sát tài nguyên hệ thống. Phân tích dữ liệu telemetry giúp phát hiện hiệu quả các executor idle chiếm tới 30% tổng tài nguyên phân bổ. Việc tối ưu hóa này giảm đáng kể chi phí compute trong khi vẫn đảm bảo performance và reliability của hệ thống. Các bài học rút ra có thể áp dụng để tối ưu hóa cluster resource allocation trong các môi trường production sử dụng Spark.
Vì sao nên đọc: Bài viết này giúp lập trình viên tối ưu hóa tài nguyên Apache Spark bằng cách chẩn đoán executor rảnh và giảm chi phí tính toán dựa trên dữ liệu từ tám triệu job mỗi ngày.
Trả lời 3 câu hỏi ngắn để nhận điểm thưởng cho bài này. Chỉ làm khi bạn muốn lấy điểm.
3 câu hỏi · dưới một phút · không bắt buộc
Nguồn: https://engineering.salesforce.com/apache-spark-resource-optimization-lessons-from-eight-million-jobs-a-day. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
The International Ice Patrol so sánh bốn hệ thống PostgreSQL truy vấn dữ liệu Apache Iceberg/Parquet, bao gồm aurora_analytics của AWS Aurora, pg_lake của Snowflake, ColdFront của pgEdge, và pg_clickhouse FDW của ClickHouse. Aurora nhúng DuckDB vào cùng tiến trình với pushdown đầy phần hoặc tùy thuộc vào biểu thức không được hỗ trợ, trong khi pg_lake chạy DuckDB tiến trình riêng và hỗ trợ ghi ACID đầy đủ nhưng rơi lại planner PostgreSQL với thống kê kém cho các heap joins. ColdFront sử dụng pg_duckdb cho tự động phân tầng hot/cold qua view với việc takeover toàn bộ kế hoạch nhưng vẫn ở beta, còn pg_clickhouse là FDW tiêu chuẩn không hỗ trợ Iceberg gốc và gặp vấn đề về ước tính cardinality. Nên dùng EXPLAIN (VERBOSE) để xác minh planner thực thi join, và mỗi công cụ phù hợp với trường hợp sử dụng cụ thể do cách planner và pushdown khác nhau.
Bài viết này giúp lập trình viên hiểu rõ cách các hệ thống tương thích PostgreSQL truy vấn dữ liệu Iceberg/Parquet và chọn công cụ phù hợp cho nhu cầu cụ thể của họ.
Booking.com đã tiết giảm chi phí compute cho Node.js tới 38% khi chuyển từ pm2 sang Watt. …
Một circuit breaker ở phía client bị mắc trong trạng thái mở trong nhiều giờ, chặn 95% lượng truy cập bất chấp dịch vụ hoàn toàn khỏe mạnh. Nguyên nhân kỹ thuật là do thuật toán backoff exponential trong circuit breaker retry mechanism tạo ra hiệu ứng thundering herd khi nhiều request đồng thời gọi hàm health check cùng lúc. Hệ quả nghiêm trọng là gần như toàn bộ traffic bị blocking gây suy giảm hiệu năng đáng kể. Bài viết cung cấp giải pháp chi tiết bằng cách thêm jitter vào backoff algorithm và triển khai custom span để theo dõi behavior này. Lập trình viên làm việc với resilience pattern nên đọc để tránh được vấn đề này trong production environment.
Bài viết này giúp giải quyết vấn đề circuit breaker bị kẹt mở gây tắc nghẽn lưu lượng hiệu quả.
Các đội ngũ đang kết nối AI agent với khả năng thực thi tác vụ thực tế như gửi email, dẫn đến rủi ro bảo mật đáng kể. Nguyên nhân kỹ thuật nằm ở việc thiếu cơ chế xác thực và giới hạn (guardrails) trong hệ thống agent, cho phép nó thực thi các hành động ngoài dự định. Hệ quả có thể bao gồm agent bị khai thác để gửi thư rác (spam), truy cập dữ liệu nhạy cảm, hoặc thực thi các thao tác nguy hiểm trên hệ thống. Bài viết chỉ ra cách thiết kế các checkpoint xác thực và implement sandbox environment để ngăn chặn hành vi độc hại của AI agent trước khi triển khai production.
Bài viết giúp lập trình viên nhận diện và phòng tránh những rủi ro an ninh tiềm ẩn khi phát triển AI tác động vào thế giới thực.
Red Hat phát triển IdeaBot trên nền tảng OpenShift để tự động hóa quy trình nghiên cứu AI nội bộ. Họ sử dụng isolated pods để cách biệt các thành phần, auth proxies để kiểm soát truy cập, và phương pháp BDD dựa trên EARS để viết test case. Giải pháp này giúp tăng cường bảo mật và giảm thiểu rủi ro trong quá trình phát triển AI. Với cách tiếp cận này, IdeaBot chứng tỏ việc xây dựng nền tảng AI an toàn hoàn toàn khả thi ngay cả trong môi trường doanh nghiệp phức tạp.
Bài viết này giúp bạn hiểu cách xây dựng và bảo mật quy trình AI bằng Red Hat IdeaBot trên OpenShift với các công nghệ hiện đại.
V8 engine gặp vấn đề khi đối tượng với __proto__: null bị mắc kẹt ở dictionary mode. Nguyên nhân kỹ thuật nằm ở cách V8 xử lý prototype chain khi prototype được đặt thành null. Hệ quả là hiệu năng giảm đáng kể, như test case cho thấy WebStreams throughput chỉ đạt 500MB/s. Điều đáng học là thay thế literal object bằng classes hoặc Object.setPrototypeOf giúp tăng hiệu năng lên 2x, đạt 1GB/s throughput trong Node core.
Tìm hiểu cách tối ưu hiệu suất bằng cách loại bỏ nguyên mẫu null để tăng gấp đôi throughput trong Node.js.
DuckDB phiên bản 1.5.6 vừa được ra mắt với các bản vá lỗi và cải thiện hiệu năng. Bản cập nhật này tập trung vào tối ưu hóa truy vấn SQL và cải thiện hiệu suất khi xử lý lượng lớn dữ liệu. Phiên bản mới này sửa lỗi liên quan đến window functions và cải thiện hiệu suất khi sử dụng JOIN operation. Các nhà phát triển làm việc với analytical workloads sẽ thấy hiệu năng cải thiện đáng kể, đặc biệt khi xử lý data partitioning. Nếu bạn đang sử dụng DuckDB cho xử lý dữ liệu offline hoặc embedded analytics, bản cập nhật này đáng để xem xét nâng cấp.
Phiên bản DuckDB 1.5.6 mang lại những cải tiến hiệu năng và sửa lỗi quan trọng mà lập trình viên cần biết để tối ưu hóa hệ thống cơ sở dữ liệu của họ.
Tempo 3.1 mang đến những cải thiện đáng kể cho Kafka client, giúp tăng hiệu suất và ổn …
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử