NNTC uses a bilinear/degree-2 polynomial decoder fitted per PBR material, in contrast to solutions using full MLP-based neural networks. While MLPs typically achieve slightly better PSNR (1-3 dB), they make GPU texture filtering harder and training is far more expensive. After optimizing the NNTC-specific CUDA encoder with BC4/BC5 awareness, it surpassed the neural network approach on raw PSNR. The author argues that correctly configured latent textures using traditional high-resolution weight planes with supercompression (RDO+LZ, DCT) make expensive MLP decoding unnecessary for PBR textures, and that NNTC's CUDA-based encoding in seconds is hard for backprop-based neural solutions to match.
Nguồn: https://richg42.blogspot.com/2026/09/notes-on-nntc-vs-neural-texturing.html. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
Vào tháng 9 năm 2026, NVIDIA đã công bố định hướng lập trình GPU gốc bằng Rust. …
Bối cảnh triển khai large language model chỉ là bước đầu trong việc phục vụ sản phẩm, các đội sản xuất cần khả năng phục vụ nhiều người dùng đồng thời càng tốt. Nguyên nhân kỹ thuật nằm ở các tối ưu hóa NIM (NVIDIA Inference Microservice) trên nền tảng Nemotron 3 Ultra giúp tăng hiệu suất đáng kể. Hệ quả là hệ thống có thể xử lý 2.5x lượng người dùng cùng lúc so với các giải pháp thông thường nhờ giảm 70% chi phí tính toán cho mỗi token. Điều đáng học là việc kết hợp tối ưu hóa full-stack từ phần cứng đến phần mềm có thể tạo ra bước nhảy vọt về hiệu quả kinh tế khi triển khai AI.
Bài viết giải thích cách tối ưu hóa Full-Stack NIM giúp tăng gấp đôi lượng người dùng trên Nemotron 3 Ultra, hữu ích cho lập trình viên muốn nâng cao hiệu suất triển khai model.
CUDA Toolkit 13.4 bổ sung hỗ trợ Windows on Arm, giúp các lập trình viên tận dụng được sức mạnh của GPU NVIDIA trên nền tảng ARM. Phiên bản này mang lại kiểm soát chi tiết hơn cho shared GPUs thông qua tính năng Multi-Process Service (MPS), cho phép nhiều process chia sẻ tài nguyên hiệu quả hơn. Performance improvements đáng kể đạt được, với tốc độ xử lý tăng lên đáng kể trong các tác vụ AI và high-performance computing. Điểm đáng học hỏi là cách NVIDIA tích hợp đa nền tảng, từ traditional x86 đến ARM, chứng tỏ chiến lược phần mềm linh hoạt. Đối với lập trình viên, bản cập nhật này mở ra cơ hội tối ưu hóa ứng dụng trên nhiều kiến trúc phần cứng khác nhau.
Lập trình viên nên đọc bài này để biết về tính năng hỗ trợ Windows on Arm và kiểm soát GPU chia sẻ trong CUDA Toolkit 13.4.
Nghiên cứu mới chỉ ra cách những thay đổi trong xử lý hình ảnh hỗ trợ khả năng phân biệt các loại đồ vật mới. Bằng cách mô hình hóa những thay đổi này trong mạng nơ-ron nhân tạo, các nhà nghiên cứu hy vọng dự đoán chính xác hơn cách đào tạo định hình nhận thức, từ đó cải thiện chiến lược giáo dục cho nhiều đối tượng học viên.
Lập trình viên nên đọc bài này để hiểu cách nhận thức hình ảnh được tái cấu trúc trong não giúp cải thiện khả năng phân biệt đối tượng mới, từ đó ứng dụng kiến thức về xử lý dữ liệu và học máy để thiết kế hệ thống AI hiệu quả hơn trong việc phân tích và học từ dữ liệu hình ảnh.
Bài viết giải thích rằng trước đây việc sao chép bản CUDA toolkit và driver phải khớp chính xác phiên bản, gây nhiều lỗi khi triển khai trên các hệ thống khác nhau. NVIDIA đã ra mắt CUDA Compatibility Pack bắt đầu từ CUDA 11.7, cho phép một bản driver duy nhất hỗ trợ nhiều phiên bản toolkit liên tiếp. Nhờ đó, trên Linux và Windows, nhà phát triển chỉ cần cập nhật driver mỗi kwartal thay vì mỗi khi nâng cấp toolkit, giảm thiểu thời gian downtime. Thử nghiệm trên các cụm GPU cho thấy tỷ lệ lỗi phiên bản driver giảm hơn 70% so với phương pháp cũ. Điều này cho thấy đầu tư vào các gói tương thích ngược có thể đơn giản hoá quy trình CI/CD cho các ứng dụng GPU-intensive.
Bài này giải thích tại sao việc khớp phiên bản driver CUDA giờ đây đơn giản hơn, giúp lập trình viên tiết kiệm thời gian và giảm thiểu lỗi hệ thống.
Collabora sẽ trình bày phiên bản tại RustConf 2026 ở Montreal về Tyr, driver kernel GPU dựa trên Rust cho phần cứng Arm Mali. Phiên bản do Daniel Almeida trình bày vào ngày 10 tháng 9 sẽ giải thích cách Tyr đưa Rust vào việc phát triển driver GPU trong Linux kernel, xây dựng trên cơ sở hạ tầng DRM của Collabora. Bài nói tập trung vào việc sử dụng Rust thay thế C trong driver GPU, mang lại lợi ích về an toàn bộ nhớ. Sự kiện này là cơ hội để gặp gỡ nhóm phát triển Tyr và tìm hiểu chi tiết về kỹ thuật triển khai driver GPU bằng Rust.
Bài này cung cấp cái nhìn sâu về việc triển khai driver GPU bằng Rust cho phần cứng Arm Mali, mở ra hướng phát triển driver nhân Linux an toàn hơn.
Arm ra mắt nền tảng CSS for Mobile 2 như một nền tảng tính toán AI‑native, nhắm vào thiết bị di động الجيل tiếp theo. Nền tảng này bao gồm hai nhân CPU C2‑Ultra và C2‑Pro, mỗi tích hợp SME2 (Scalable Matrix Extension 2) để tăng tốc phép toán ma trận. Đồng thời, nó đi kèm với GPU Mali G2‑Ultra NX, được tối ưu cho workloads AI và đồ họa song song. Kết hợp SME2 và GPU mới cho phép tăng hiệu suất AI lên tới vài chục phần trăm so với thế hệ trước, đồng thời giảm tiêu thụ năng lượng mỗi phép tính. Điều này cho thấy xu hướng đưa các phần mở rộng ma trận chuyên dụng và GPU mạnh vào cùng một SoC để xây dựng nền tảng AI‑native, là bài học quan trọng cho các nhà thiết kế chip khi cân nhắc đọc bài gốc.
Bài viết này giúp lập trình viên nắm bắt kiến thức về nền tảng tính toán AI-native mới nhất từ Arm để tối ưu hóa hiệu năng ứng dụng di động.
Tôi từng học sơ lược về RISC và CISC ở đại học nhưng giờ hầu như quên hết.
Nếu bạn đang phát triển ứng dụng AI hoặc xử lý dữ liệu lớn, hiểu rõ sự khác biệt giữa kiến trúc RISC và CISC sẽ giúp bạn tối ưu hiệu suất và lựa chọn thiết bị (TPU, GPU, CPU) phù hợp với công việc của mình.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử