Meta engineers extend FlashAttention-4 with end-to-end MXFP8 (microscaling FP8) support for both forward and backward passes on NVIDIA Blackwell GPUs, targeting production Ads recommendation model (GEM) training. The work covers TMEM allocation strategies to fit scale factors alongside MMA accumulators, online transpose-invariant square block-scale quantization for dS using Blackwell's redux.sync.max.abs.f32 instruction, fused RMSNorm+Quantize and GEMM+Quantize kernels that eliminate separate quantization passes, and a zero-gather jagged module that keeps FP8 data compact while only scale factors get padded and permuted for TMA. Results show up to 1.6x forward and 1.52x backward speedups over BF16 on internal shapes, reaching 2.85 PF/s forward and up to 1.98 PF/s backward on LLM shapes, competitive with cuDNN 9.24. The code is open-sourced in Meta's Ads Model Kernel Library on GitHub.
Source: https://pytorch.org/blog/low-precision-flash-attention-4-end-to-end-block-scaled-attention-for-blackwell. 8 Sync News only summarizes and links out; content copyright belongs to the authors and original sources.
Đang tải bình luận…
Bài viết giới thiệu phương pháp Quantization‑Aware Healing (QAH) được phát triển bởi Multiverse Computing để nén mô hình ngôn ngữ lớn xuống 4‑bit mà không làm giảm hiệu suất. QAH kết hợp quantization‑aware training với một bước healing sau huấn luyện, trong đó một mạng phụ nhỏ được học để bù lại sai số lượng tử hóa gây ra. Kết quả cho thấy mô hình 4‑bit sau healing đạt được mức perplexity tương đương, và trong một số trường hợp thậm chí tốt hơn so với phiên bản full‑precision (32‑bit) ban đầu. Việc này đồng thời giảm kích thước bộ nhớ cần thiết xuống khoảng 1⁄8 (≈87,5%) và tăng tốc độ suy luận trên phần cứng hỗ trợ tính toán nguyên số. Điều đáng học là việc đầu tư vào quá trình healing có thể bù lại phần lớn tổn thất từ quantization, cho phép triển khai mô hình mạnh mẽ trên môi trường tài nguyên hạn chế mà không hy sinh chất lượng.
Bài viết này giúp lập trình viên hiểu cách tạo mô hình lượng hóa 4-bit hiệu suất hơn cả mô hình full-precision gốc.
Bài báo arXiv 2607.11938 giới thiệu phần tóm tắt về lĩnh vực "Toán học của Khoa học Dữ liệu", đề cập đến các nền tảng toán học ứng dụng trong phân tích dữ liệu.
Những kỹ thuật toán và lý thuyết toán học trong bài viết này sẽ giúp bạn hiểu sâu hơn về cách xây dựng mô hình học máy hiệu quả hơn, từ đó tối ưu hóa thời gian và chất lượng dự án của mình.
Bối cảnh của bài viết nhấn mạnh rằng Data Science và Machine Learning không chỉ đơn thuần là lập trình. Nguyên nhân kỹ thuật là nhiều người tập trung quá mức vào công cụ như Python hay TensorFlow mà bỏ qua nền tảng vấn đề. Hệ quả là các dự án AI thất bại do thiếu hiểu biết domain knowledge và không xác định đúng problem statement. Điều đáng học là cần ưu tiên bối cảnh (context), giải quyết vấn đề (problem solving) và sự hiểu biết (understanding) trước khi đến với tools.
Bài viết này giúp lập trình viên nhận ra rằng Data Science và Machine Learning không chỉ là kỹ năng lập trình mà cần hiểu bối cảnh và tư duy giải quyết vấn đề trước tiên.
Nhà nghiên cứu Lauren Leek phát hiện thuật toán xếp hạng nhà hàng của Google Maps ưu tiên chuỗi cửa hàng, địa điểm đông khách và các vị trí được trả phí, khiến những quán mới hoặc ít tên tuổi khó nổi bật. Cô xây dựng bảng điều khiển công khai sử dụng machine learning để khám phá những quán ẩn mình có chất lượng vượt trội.
Những lập trình viên muốn hiểu cách hệ thống xếp hạng tự động của Google Maps hoạt động, từ đó tìm cách cải thiện hoặc phân tích các cơ chế xếp hạng trong các ứng dụng tương tự để tạo ra giải pháp công bằng và hiệu quả hơn.
Google Cloud vừa giới thiệu TPU Developer Hub, một nền tảng giáo dục tập trung dành cho nhà phát triển ML sử dụng TPU, bao gồm kiến trúc phần cứng, stack phần mềm (XLA, Pallas kernels), công cụ gỡ lỗi XProf, chiến lược tối ưu hóa (như offloading KV cache) cùng networking và bảo mật. Nội dung đa dạng từ Colabs tương tác, mã nguồn mở đến tài liệu chuyên sâu, hỗ trợ tích hợp AI-assisted development.
Lập trình viên ML nên đọc để hiểu cách tối ưu hóa hiệu suất và chi phí của mô hình trên TPU với các công cụ mới như XLA, Pallas và các chiến lược parallelism, từ đó tiết kiệm thời gian và nguồn lực trong triển khai sản phẩm AI.
Bối cảnh là một lập trình viên MERN và PERN fullstack bắt đầu học Data Science tại Dataraflow. Nguyên nhân kỹ thuật là việc chuyển đổi từ backend development sang data science gặp phải nhiều thách thức với Python và các bug trong shopping cart project. Hệ quả là bài viết chia sẻ những khó khăn thực tế khi áp dụng kỹ năng lập trình truyền thống vào lĩnh vực data science. Điều đáng học là về tầm quan trọng của việc nắm vững Python libraries như Pandas và NumPy, cùng với việc hiểu sâu về domain-specific problems trong data science.
Bài này chia sẻ kinh nghiệm thực tế và bài học quý giá từ tuần đầu học Data Science, giúp lập trình viên chuẩn bị tâm thế tốt hơn khi chuyển hướng sang lĩnh vực mới.
Một bài viết mới cho thấy các mô hình LLM mã nguồn mở như Qwen3.8 27B và Qwen3.6 đã giảm thiểu lợi thế cạnh tranh mà Anthropic và OpenAI từng có nhờ chi phí tính toán khổng lồ. Các phiên bản đã quan sát hoá của chúng được chạy trên máy Mac Studio với 256GB RAM và có thể được giảm xuống để hoạt động trên PC chơi game chỉ có 32GB RAM, trong khi một mô hình 1-bit vẫn chạy trên thiết bị 16GB, dù chất lượng bị giảm. Do đó, phần cứng vật lý trở thành rào cản duy nhất để triển khai các mô hình lớn tại chỗ thay vì phụ thuộc vào dịch vụ đám mây có chủ sở hữu. Đối với các lập trình viên cân nhắc có nên đọc bài gốc, họ sẽ thấy rằng các cải tiến hiệu suất đang làm chậm sự khác biệt giữa môi trường mở và khép kín, khiến việc triển khai tại chỗ ngày càng khả thi. Bài viết nêu con số cụ thể như 27B, 32GB, 16
Bài viết này giúp lập trình viên hiểu xu hướng chạy các mô hình AI mạnh mẽ ngay tại máy cá nhân thay vì phụ thuộc vào dịch vụ đám mây.
Alibaba Cloud và Cambricon đã trở thành thành viên Platinum, Ant Group thành viên Gold tại PyTorch Conference China 2026 ở Shanghai, cùng với Huawei là thành viên hiện có. Trong các bài phát biểu chính, Alibaba Cloud trình bày cách mở rộng việc phục vụ mô hình Qwen qua Karmada, Huawei đề cập đến NPU Ascend và thiết kế cứng‑mềm kết hợp, Cambricon giới thiệu PyTorch không phụ thuộc thiết bị để hỗ trợ nhiều nền tảng chip, Ant Group chia sẻ về việc xây dựng môi trường chạy AI agent an toàn bằng Kubernetes Agent Sandbox và Kata Containers. Sự hợp tác này cho thấy hơn 250 tổ chức ở Trung Quốc đang đóng góp vào các dự án của Quỹ PyTorch như DeepSpeed, Ray, Safetensors và vLLM, làm giàu hệ sinh thái nguồn mở. Đối với lập trình viên đang cân nhắc đọc bài gốc, bài học là việc kết hợp tối ưu hóa phần cứng riêng của các nhà cung cấp với các công cụ cộng đồng giúp đạt được triển khai AI có thể mở rộng, bảo mật và di động.
Bài viết này cho thấy hợp tác của các tập đoàn công nghệ hàng đầu Trung Quốc trong thúc đẩy stack AI mở thông qua PyTorch, mang lại hiểu biết sâu sắc về xu hướng phát triển AI và hợp tác công nghệ.
Read the news here, practice coding, follow structured courses and train for IELTS on our sibling products — all connected through one 8 Sync account.
The ecosystem home: product overviews, blog and full pricing.
ExploreLearn along a clear roadmap: videos, auto-graded quizzes, certificates and mentors who ship for a living.
View the roadmap1,000+ DSA problems in Vietnamese, auto-graded across 7 languages — many FREE, right in your browser.
Practice for freeAI grading for all four IELTS skills with detailed rubric feedback.
Try it freeA 22 MB AI IDE for Vietnamese devs.
Download freeOrganizational memory for AI agents.
ExploreAI that staffs your Fanpage and qualifies leads for you.
Try it