AMD released Lemonade 11.8, adding an experimental DwarfStar 'ds4' backend that makes it easy to run the DeepSeek V4 Flash model on AMD Ryzen AI Max 'Strix Halo' systems like the Framework Desktop. The release also adds new models to its catalog (RPG-HaloTales-V2 chat model, Flux-2-Klein-4B/9B image models, OpenMOSS voice-design and sound-effect speech models) and a new 'lemonade update-models' command, among other enhancements.
Nguồn: https://www.phoronix.com/news/AMD-Lemonade-11.8. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
Bài viết hướng dẫn cách áp dụng speculative decoding trong framework vLLM khi chạy trên GPU AMD, giải thích cơ chế draft‑and‑verify và các kỹ thuật hỗ trợ như MTP, EAGLE‑3, DFlash và DSpark. Nó cho thấy việc sử dụng mô hình nháp để dự đoán trước các token rồi xác thực bằng mô hình đích giúp giảm số lần truy cập bộ nhớ và tăng tỷ lệ sử dụng lõi tính toán trên kiến trúc AMD CDNA. Kết quả thực nghiệm cho thấy throughput tăng lên đáng kể (thường gấp 1,5‑2×) và latency giảm khi cấu hình đúng kích thước batch và các tham số tuning cụ thể cho từng kernel. Điều này cho thấy lợi thế của speculative decoding không chỉ phụ thuộc vào thuật toán mà còn vào việc tối ưu hóa phần cứng cụ thể, đặc biệt là việc sử dụng DFlash để tối ưu hoá attention và DSpark để quản lý memory traffic trên GPU AMD. Bài viết nên được đọc nếu bạn muốn áp dụng hoặc cải thiện speculative decoding trên hệ thống AMD và cần tham khảo các bước cấu hình, tuning và benchmark thực tế.
Bài viết này cung cấp hướng dẫn thực tế về speculative decoding trên GPU AMD, giúp lập trình viên tối ưu hóa hiệu suất xử lý mô hình ngôn ngữ.
Reasoning traces là quá trình ghi lại và phân tích các bước logic, suy luận trong quá trình giải quyết vấn đề của mô hình AI, giúp hiểu rõ cách mô hình đưa ra quyết định.
Lập trình viên nên đọc bài này để hiểu cách tracing logic giúp debug và tối ưu hóa mã bằng cách theo dõi các quyết định điều kiện, vòng lặp và dữ liệu thực tế trong quá trình chạy chương trình.
Phân tích chi phí sơ lược cho thấy suy luận (inference) AI thực sự sinh lời, với chi phí ước tính khoảng 1 USD cho mỗi triệu token đầu ra, thấp hơn nhiều so với mức giá 4,5 USD trở lên của các nhà cung cấp như OpenAI, qua đó đạt biên lợi nhuận gộp 70–80%. Suy luận AI có lợi nhuận, nhưng các phòng thí nghiệm AI như OpenAI và Anthropic sử dụng khoản lợi nhuận này để bù đắp chi phí đào tạo mô hình tốn kém.
Là người phát triển muốn tối ưu chi phí cho ứng dụng AI của mình, bài viết này giúp bạn hiểu rõ về lợi nhuận thực tế của quá trình inference AI, từ đó có thể xây dựng mô hình kinh doanh hiệu quả và tránh bỏ lỡ cơ hội tiết kiệm chi phí mà không phụ thuộc vào sự hỗ trợ từ các công ty lớn.
Quán bar AGI Bar ở khu công nghệ Trung Quan Thôn, Bắc Kinh cung cấp token DeepSeek miễn phí thay vì Wi-Fi, tự vận hành mô hình trên hai máy trạm Nvidia. Đây là biểu tượng cho sự bùng nổ AI tại Trung Quốc và những lo ngại về bong bóng công nghệ.
Một lập trình viên nên đọc bài này để hiểu cách các công ty và cộng đồng AI đang chuyển đổi từ cơ sở hạ tầng truyền thống sang mô hình tự chủ, tự động hóa bằng các mô hình ngôn ngữ lớn, và xem xét những thách thức về chi phí, hiệu suất cũng như tương lai của các nền tảng AI mở trong thời đại phát triển nhanh chóng của công nghệ.
AMD mua lại Taalas nhằm nâng cao hiệu suất inference bằng cách khắc mô hình AI trực tiếp lên vi mạch. Các bản demo ban đầu cho thấy các mạch tích hợp chuyên dụng (model-specific integrated circuits) có thể xử lý tới 17.000 token mỗi giây.
Lập trình viên AI cần đọc để hiểu cách AMD đang tận dụng silicon custom hóa để cải thiện hiệu suất xử lý mô hình deep learning, đặc biệt là trong việc tối ưu hóa các ứng dụng inference trên thiết bị edge, giúp tiết kiệm chi phí và tăng tốc độ triển khai.
Tuần này có nhiều cập nhật AI đáng chú ý: Grok 4.6 và Grok Bot ra mắt, DeepSeek v4 Pro chính thức ra mắt, Meta giới thiệu Muse Glimmer và hứa hẹn Spark, trong khi Gemini thay thế Pro bằng phiên bản Flash 3.7. Ngoài ra, Coreweave giới thiệu buổi thảo luận ThursdAI với đại diện từ NVIDIA, Artificial Analysis và Cursor/SpaceXAI.
Lập trình viên nên đọc bài này vì nó cung cấp những thông tin mới nhất về tiến bộ AI hiện tại, bao gồm các mô hình như Grok 4.6 và DeepSeek v4 Pro, giúp bạn cập nhật kiến thức để tối ưu hóa công cụ AI trong phát triển phần mềm hiệu quả.
DeepSeek tăng giá mô hình V4-Pro lên 3,96 USD mỗi triệu token vào thời điểm cao điểm và tung ra phiên bản mã nguồn mở cạnh tranh trực tiếp với Claude Code của Anthropic.
Lập trình viên nên theo dõi để cập nhật về xu hướng giá và tính năng mới của các mô hình AI hỗ trợ mã, giúp họ đánh giá hiệu quả sử dụng và lựa chọn công cụ phù hợp cho dự án của mình.
DeepSeek V4 Pro trên Vercel AI Gateway đã cập nhật weights mặc định, các yêu cầu hiện tại tự động sử dụng phiên bản mới mà không cần thay đổi code, trong khi model ID cũ vẫn giữ nguyên phiên bản cũ.
Lập trình viên phát triển ứng dụng AI nên đọc để hiểu cách tối ưu hóa quy trình triển khai mô hình AI mới nhất mà không cần thay đổi mã, giúp tiết kiệm thời gian và công sức trong việc cập nhật và deploy.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử