Meta engineers extend FlashAttention-4 with end-to-end MXFP8 (microscaling FP8) support for both forward and backward passes on NVIDIA Blackwell GPUs, targeting production Ads recommendation model (GEM) training. The work covers TMEM allocation strategies to fit scale factors alongside MMA accumulators, online transpose-invariant square block-scale quantization for dS using Blackwell's redux.sync.max.abs.f32 instruction, fused RMSNorm+Quantize and GEMM+Quantize kernels that eliminate separate quantization passes, and a zero-gather jagged module that keeps FP8 data compact while only scale factors get padded and permuted for TMA. Results show up to 1.6x forward and 1.52x backward speedups over BF16 on internal shapes, reaching 2.85 PF/s forward and up to 1.98 PF/s backward on LLM shapes, competitive with cuDNN 9.24. The code is open-sourced in Meta's Ads Model Kernel Library on GitHub.
Source: https://pytorch.org/blog/low-precision-flash-attention-4-end-to-end-block-scaled-attention-for-blackwell. 8 Sync News only summarizes and links out; content copyright belongs to the authors and original sources.
Đang tải bình luận…
Google vừa tích hợp Colab vào Google AI plan, mang lại lợi ích cao cấp cho người đăng ký. Các lập trình viên giờ đây có truy cập vào faster accelerators và Premium GPUs để tăng tốc độ xử lý. Đặc biệt, tính năng uninterrupted background execution cho phép chạy training kéo dài mà không bị gián đoạn. Đây là bước đi chiến lược giúp Google củng cố vị thế trong việc cung cấp công cụ AI cho nhà phát triển.
Bài viết giúp lập trình viên biết cách tận dụng Colab trong Google AI plan với các tính năng cao cấp để tăng tốc độ và hiệu quả công việc AI.
Geoffrey Hinton được mệnh danh là "Godfather of AI" đã phát triển khóa học trên freeCodeCamp.org YouTube, giúp bạn thành thạo mạng nơ-ron hiện đại bằng cách tái tạo các bước đột phá lịch sử. Khóa học bắt đầu từ neural network truyền thống đến modern deep learning với các ví dụ code cụ thể trên framework PyTorch. Hinton giải thích chi tiết quá trình phát triển của backpropagation, convolutional neural networks và transformer models. Bạn sẽ hiểu tại sao dropout giảm overfitting từ 27% xuống 2.5% và cách attention mechanism thay đổi hoàn toàn NLP. Khóa học này là cơ hội hiếm hoi để học trực tiếp từ người đặt nền móng cho deep learning revolution.
Khóa học giúp bạn nắm vững mạng nơ-ron hiện đại bằng cách tái tạo những tiến trình đột phá trong lịch sử trí tuệ nhân tạo.
TinyTorch là một chương trình open-source giúp người học xây dựng framework ML từ đầu với tensors đến transformers, hoàn toàn bằng Python và API của PyTorch, chạy được trên laptop chỉ 4GB RAM không cần GPU. Dự án phát triển chậm trong 5 năm trước khi bùng nổ mạng xã hội, GitHub stars tăng từ 2,000 lên hơn 27,000 trong 11 tháng với 95+ người đóng góp và được 50+ trường đại học sử dụng. Tác giả chia sẻ bài học: sao chép chính xác production API, quyết định ràng buộc phần cứng trước khi tính năng, đầu tư cơ sở hạ tầng giảng dạy (chấm điểm, tiêu chí) và kế hoạch kế thừa sớm. TinyTorch vẫn còn khoảng trống chưa đo lường được kết quả học tập và chưa hỗ trợ GPU kernels hay distributed training.
TinyTorch giúp lập trình viên hiểu sâu nguyên lý hoạt động của PyTorch qua việc tự xây dựng một framework học máy từ cơ bản đến nâng cao.
Bài viết giới thiệu phương pháp Quantization‑Aware Healing (QAH) được phát triển bởi Multiverse Computing để nén mô hình ngôn ngữ lớn xuống 4‑bit mà không làm giảm hiệu suất. QAH kết hợp quantization‑aware training với một bước healing sau huấn luyện, trong đó một mạng phụ nhỏ được học để bù lại sai số lượng tử hóa gây ra. Kết quả cho thấy mô hình 4‑bit sau healing đạt được mức perplexity tương đương, và trong một số trường hợp thậm chí tốt hơn so với phiên bản full‑precision (32‑bit) ban đầu. Việc này đồng thời giảm kích thước bộ nhớ cần thiết xuống khoảng 1⁄8 (≈87,5%) và tăng tốc độ suy luận trên phần cứng hỗ trợ tính toán nguyên số. Điều đáng học là việc đầu tư vào quá trình healing có thể bù lại phần lớn tổn thất từ quantization, cho phép triển khai mô hình mạnh mẽ trên môi trường tài nguyên hạn chế mà không hy sinh chất lượng.
Bài viết này giúp lập trình viên hiểu cách tạo mô hình lượng hóa 4-bit hiệu suất hơn cả mô hình full-precision gốc.
Bài báo arXiv 2607.11938 giới thiệu phần tóm tắt về lĩnh vực "Toán học của Khoa học Dữ liệu", đề cập đến các nền tảng toán học ứng dụng trong phân tích dữ liệu.
Những kỹ thuật toán và lý thuyết toán học trong bài viết này sẽ giúp bạn hiểu sâu hơn về cách xây dựng mô hình học máy hiệu quả hơn, từ đó tối ưu hóa thời gian và chất lượng dự án của mình.
Bài viết giải quyết vấn đề chuyển đổi RECIST line (đo thẳng) thành 3D tumor segmentation mask (khối u 3D) trong y học hình ảnh. Phương pháp sử dụng deep learning model như UNet để dự đoán hình dạng 3D từ các đo thẳng trên CT scan. Kết quả cho độ chính xác lên đến 89% khi so sánh với manual segmentation. Điều đáng học là kỹ thuật này giảm 70% thời gian làm việc so với phương pháp thủ công truyền thống.
Bài này giúp lập trình viên chuyển đổi RECIST line thành 3D tumor segmentation mask một cách hiệu quả.
Nhà nghiên cứu Lauren Leek phát hiện thuật toán xếp hạng nhà hàng của Google Maps ưu tiên chuỗi cửa hàng, địa điểm đông khách và các vị trí được trả phí, khiến những quán mới hoặc ít tên tuổi khó nổi bật. Cô xây dựng bảng điều khiển công khai sử dụng machine learning để khám phá những quán ẩn mình có chất lượng vượt trội.
Những lập trình viên muốn hiểu cách hệ thống xếp hạng tự động của Google Maps hoạt động, từ đó tìm cách cải thiện hoặc phân tích các cơ chế xếp hạng trong các ứng dụng tương tự để tạo ra giải pháp công bằng và hiệu quả hơn.
Google Cloud vừa giới thiệu TPU Developer Hub, một nền tảng giáo dục tập trung dành cho nhà phát triển ML sử dụng TPU, bao gồm kiến trúc phần cứng, stack phần mềm (XLA, Pallas kernels), công cụ gỡ lỗi XProf, chiến lược tối ưu hóa (như offloading KV cache) cùng networking và bảo mật. Nội dung đa dạng từ Colabs tương tác, mã nguồn mở đến tài liệu chuyên sâu, hỗ trợ tích hợp AI-assisted development.
Lập trình viên ML nên đọc để hiểu cách tối ưu hóa hiệu suất và chi phí của mô hình trên TPU với các công cụ mới như XLA, Pallas và các chiến lược parallelism, từ đó tiết kiệm thời gian và nguồn lực trong triển khai sản phẩm AI.
Read the news here, practice coding, follow structured courses and train for IELTS on our sibling products — all connected through one 8 Sync account.
The ecosystem home: product overviews, blog and full pricing.
ExploreLearn along a clear roadmap: videos, auto-graded quizzes, certificates and mentors who ship for a living.
View the roadmap1,000+ DSA problems in Vietnamese, auto-graded across 7 languages — many FREE, right in your browser.
Practice for freeAI grading for all four IELTS skills with detailed rubric feedback.
Try it freeA 22 MB AI IDE for Vietnamese devs.
Download freeOrganizational memory for AI agents.
ExploreAI that staffs your Fanpage and qualifies leads for you.
Try it