GCC has merged initial support for AI Compute Extensions (ACEv1), a new joint Intel/AMD matrix acceleration architecture intended as the successor to Intel's Advanced Matrix Extensions (AMX), targeting future generation CPUs. The support landed in GCC's Git repository for the upcoming GCC 17 release, following patches submitted since July by Intel and AMD compiler engineers. A new -macev1 compiler flag enables ACEv1 built-in functions and code generation, implying AVX10.1, AVX/AVX2, and SSE/SSE4 support. GCC 17.1 is expected around March-April with this first-generation ACE support, and parallel enablement work is underway for LLVM/Clang via an open pull request.
Nguồn: https://www.phoronix.com/news/GCC-17-Merges-ACE-v1. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
AMD đã đạt mức định giá 1 tỷ USD lần đầu tiên, đồng thời Nasdaq đóng cửa ở mức kỷ lục khi các nhà đầu tư đặt cược vào việc chi tiêu cho AI vẫn đang tăng trưởng. Động lực chính đằng sau đà tăng này là nhu cầu mạnh mẽ cho bộ xử lý GPU của AMD trong thị trường AI, đặc biệt là dòng Instinct MI300. Sự thành công này cho thấy AMD đang cạnh tranh trực tiếp với NVIDIA trong lĩnh vực AI accelerator. Bài phân tích cung cấp cái nhìn sâu sắc về cách AMD tận dụng làn sóng AI để tạo ra giá trị thị trường khổng lồ, điều mà các lập trình viên quan tâm đến xu hướng công nghệ nên theo dõi.
Tin tức này giúp lập trình viên hiểu xu hướng đầu tư công nghệ AI đang định hình giá trị các công ty phần cứng hàng đầu.
Bối cảnh: Nhiều lập trình viên vẫn tin vào những quan niệm lỗi thời về CPU, dẫn đến lựa chọn không tối ưu. Nguyên nhân kỹ thuật: Các công nghệ như Intel Turbo Boost, ARM big.LITTLE và bộ đệm L3 cache đã thay đổi cách CPU hoạt động, khiến các myth về clock speed đơn thuần hay core count trở nên lỗi thời. Hệ quả: Việc dựa vào các tiêu chí lỗi thời có thể khiến bạn bỏ lỡ các giải pháp hiệu quả hơn, ví dụ như việc một chip Apple M1 với 8 core nhưng chỉ 4 performance cores có thể vượt trội hơn nhiều CPU Intel core count cao hơn. Điều đáng học: Bạn cần cập nhật kiến thức về công nghệ CPU hiện đại để đưa ra quyết định kỹ thuật chính xác, đặc biệt khi đánh giá hiệu năng tổng thể thay vì chỉ tập trung vào các con số đơn lẻ như GHz hay core count.
Bài viết này sẽ giúp bạn loại bỏ những quan niệm sai lầm về CPU đã lỗi thời để cập nhật kiến thức công nghệ hiện đại.
ACEMAGIC gửi mẫu Kron Mini K5 Wildcat Lake mini PC để mình xem xét. Máy được cấu hình với Intel Core 3 304 hoặc Core 5 320 CPU, kèm tùy chọn RAM và storage. Kết quả là một thiết bị nhỏ gọn nhưng đủ sức chạy các công cụ phát triển nhẹ. Điều này cho thấy việc lựa chọn CPU affect performance và giá cả. Nếu bạn đang cân nhắc mua mini PC cho môi trường test nhanh, mẫu này đáng để xem chi tiết hơn.
Bài này cung cấp thông tin chi tiết về cấu hình và trải nghiệm ban đầu với ACEMAGIC Kron Mini K5 Wildcat Lake mini PC.
AMD mua lại Taalas nhằm nâng cao hiệu suất inference bằng cách khắc mô hình AI trực tiếp lên vi mạch. Các bản demo ban đầu cho thấy các mạch tích hợp chuyên dụng (model-specific integrated circuits) có thể xử lý tới 17.000 token mỗi giây.
Lập trình viên AI cần đọc để hiểu cách AMD đang tận dụng silicon custom hóa để cải thiện hiệu suất xử lý mô hình deep learning, đặc biệt là trong việc tối ưu hóa các ứng dụng inference trên thiết bị edge, giúp tiết kiệm chi phí và tăng tốc độ triển khai.
Bài viết hướng dẫn cách áp dụng speculative decoding trong framework vLLM khi chạy trên GPU AMD, giải thích cơ chế draft‑and‑verify và các kỹ thuật hỗ trợ như MTP, EAGLE‑3, DFlash và DSpark. Nó cho thấy việc sử dụng mô hình nháp để dự đoán trước các token rồi xác thực bằng mô hình đích giúp giảm số lần truy cập bộ nhớ và tăng tỷ lệ sử dụng lõi tính toán trên kiến trúc AMD CDNA. Kết quả thực nghiệm cho thấy throughput tăng lên đáng kể (thường gấp 1,5‑2×) và latency giảm khi cấu hình đúng kích thước batch và các tham số tuning cụ thể cho từng kernel. Điều này cho thấy lợi thế của speculative decoding không chỉ phụ thuộc vào thuật toán mà còn vào việc tối ưu hóa phần cứng cụ thể, đặc biệt là việc sử dụng DFlash để tối ưu hoá attention và DSpark để quản lý memory traffic trên GPU AMD. Bài viết nên được đọc nếu bạn muốn áp dụng hoặc cải thiện speculative decoding trên hệ thống AMD và cần tham khảo các bước cấu hình, tuning và benchmark thực tế.
Bài viết này cung cấp hướng dẫn thực tế về speculative decoding trên GPU AMD, giúp lập trình viên tối ưu hóa hiệu suất xử lý mô hình ngôn ngữ.
This article is sponsored by Dell
Chiếc laptop mỏng nhẹ của Lenovo được thiết kế để giữ các phần cứng quan trọng như cổng kết nối, bàn phím và touchpad luôn dễ dàng truy cập.
Lập trình viên nên đọc bài này để biết cách tối ưu hóa thiết bị laptop với cấu hình phù hợp, tránh lãng phí tài nguyên khi chọn máy có bộ vi xử lý, RAM và bộ nhớ SSD phù hợp với nhu cầu phát triển ứng dụng và chạy môi trường ảo hóa hiệu quả.
A Linux kernel patch reveals that upcoming AMD Zen 6 processors will include a new hardware security feature called Branch Target Buffer (BTB) context isolation, which separates user/kernel and guest/host execution contexts to defend against branch prediction attacks like Speculative Return Stack Overflow (SRSO). Because Zen 6's BTB isolation handles these vectors natively, the SafeRET software mitigation used on earlier Zen generations becomes unnecessary on Zen 6, though user/user and guest/guest attack vectors still require the existing Spectre v2 IBPB-on-context-switch mitigation. The kernel patch adds detection and reporting of this new hardware protection via a new mitigation string, and is queued in tip/tip.git's x86/bugs branch, likely landing in Linux v7.4 or as a fix for v7.3.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử