YOLO26 là phiên bản mới nhất của họat YOLO, được Ultralytics phát hành để cân bằng tốc độ và độ chính xác trên bộ dữ liệu COCO. YOLOE-26 mở rộng YOLO26 bằng việc tích hợp ba loại prompt: văn bản, hình ảnh và zero‑shot, cho phép mô hình nhận diện các lớp đối tượng chưa thấy trong quá trình huấn luyện. Khi được cung cấp một chuỗi mô tả hoặc một ảnh tham khảo, YOLOE-26 tạo ra embedding đa modal và thực hiện suy luận trực tiếp mà không cần fine‑tune lại trọng số. Trong các ví dụ thực hành của Ultralytics, YOLOE-26 đạt được mAP khoảng 38,5 trên COCO cho các lớp mới, trong khi thời gian inference vẫn duy trì khoảng 28 ms trên GPU RTX 3080. Điều này cho thấy việc kết hợp prompt đa modal và zero‑shot có thể mở rộng khả năng của YOLO mà không hy sinh hiệu suất, một bài học quan trọng cho những ai cần phát triển hệ thống phát hiện đối tượng linh hoạt.
Vì sao nên đọc: Bài viết này giúp lập trình viên nắm được cách mở rộng khả năng phát hiện đối tượng với từ vựng mở bằng YOLOE-26.
Trả lời 3 câu hỏi ngắn để nhận điểm thưởng cho bài này. Chỉ làm khi bạn muốn lấy điểm.
3 câu hỏi · dưới một phút · không bắt buộc
Nguồn: https://pyimagesearch.com/2026/08/24/yolo26-open-vocabulary-object-detection-with-yoloe-26. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
Bài viết giải quyết vấn đề chuyển đổi RECIST line (đo thẳng) thành 3D tumor segmentation mask (khối u 3D) trong y học hình ảnh. Phương pháp sử dụng deep learning model như UNet để dự đoán hình dạng 3D từ các đo thẳng trên CT scan. Kết quả cho độ chính xác lên đến 89% khi so sánh với manual segmentation. Điều đáng học là kỹ thuật này giảm 70% thời gian làm việc so với phương pháp thủ công truyền thống.
Bài này giúp lập trình viên chuyển đổi RECIST line thành 3D tumor segmentation mask một cách hiệu quả.
Cần tạo hiệu ứng mặt nạ 3D thời gian thực trên web mà không phụ thuộc vào phần cứng chuyên dụng. Bài viết sử dụng MediaPipe Face Mesh để trích xuất 468 điểm landmark khuôn mặt, sau đó ánh xạ chúng lên mô hình mặt chuẩn của Google để tạo lưới đa giác phù hợp. Các điểm landmark được truyền qua Threlte – bộ bao Svelte cho Three.js – để cập nhật vị trí và hướng của đối tượng Three.js mỗi khung hình, cho phép render mặt nạ có texture ở khoảng 60 FPS trên trình duyệt hiện đại. Kết hợp việc ước lượng tư thế dựa trên ML với rendering WebGL qua framework component-based giúp giảm lượng mã boilerplate và duy trì hiệu suất cao mà không cần viết shader phức tạp. Điều này cho thấy việc tách biệt giai đoạn xử lý landmark (CPU) và giai đoạn render (GPU) là chìa khóa để đạt được trải nghiệm AR mượt mà trên web.
Bài này sẽ giúp bạn nắm cách kết hợp MediaPipe, Threlte và Three.js để tạo mặt nạ 3D thời gian thực trên trình duyệt.
Bài benchmark đánh giá 4 model LLM (GPT-5.6-Sol, Gemini 3.7 Flash, GLM-5.3-Flash, Claude Fable 5.1) trong nhiệm vụ nhận diện nấm độc/ăn được trên dataset FungiTastic. Kết quả cho thấy tỷ lệ lỗi nguy hiểm lên tới 30-40% khi phân biệt nấm độc, đặc biệt là các loài có hình thái tương tự nấm ăn được. Nguyên nhân chính là do các model thiếu dữ liệu chuyên sâu về đặc điểm vi sinh vật và phản ứng sinh hóa của nấm, dẫn đến khả năng general hóa kém. Hệ quả là người dùng có thể bị gợi ý sai dẫn đến ngộ độc nếu tin tưởng hoàn toàn vào kết quả AI. Điều đáng học là ngay cả các model tiên tiến nhất cũng cần dữ liệu domain-specific chất lượng cao và cơ chế cảnh báo rủi ro rõ ràng khi ứng dụng trong lĩnh vực y tế/đời sống.
Bài viết cảnh báo những sai lệch nguy hiểm khi AI xác định nấm ăn được hay độc.
Alma Media phát triển một bộ phân loại hình ảnh riêng cho ảnh đăng bán bất động sản với 23 lớp phòng và nội dung, đồng thời đưa ra một khung quyết định để chọn giữa gọi API VLM hay huấn luyện mô hình riêng, chọn mô hình nền tảng và quyết định fine‑tune hay freeze backbone. Họ thực nghiệm trên tập dữ liệu riêng 40.000 ảnh, so sánh SigLIP freeze, DINOv2 freeze và SigLIP fine‑tune bằng LoRA, kết quả cho thấy LoRA nâng micro F1 từ 78,4% lên 82,6% và giảm tỷ lệ ảnh chưa gắn nhãn từ 9,4% xuống 3,4%, gần với mức cơ bản tự nhiên 3,9%. Lớp GARDEN nhận được tăng recall 26 điểm, trong khi việc đơn giản chuyển sang DINOv2 đã hồi phục hơn một nửa của khoảng cách này mà không cần fine‑tune. So sánh chi phí cho thấy việc sử dụng API VLM như Gemini tốn khoảng 1.500 USD cho mỗi triệu ảnh, natomiast bộ phân loại chạy trên GPU riêng chỉ tốn khoảng 0,37 USD cho cùng lượng ảnh, và việc thực hiện toàn bộ quá trình quét siêu tham số LoRA chỉ tốn khoảng 30 USD. Bài học là mặc dù fine‑tune có thể cải thiện chỉ số, nhưng việc lựa chọn mô hình nền tảng phù hợp và cân nhắc chi phí thường làm cho việc freeze backbone hoặc chuyển mô hình trở thành lựa chọn hiệu quả hơn.
Bài viết này cung cấp framework ra quyết định chi tiết và so sánh thực tế giữa việc fine-tune SigLIP, sử dụng DINOv2 hay gọi API VLM giúp lập trình viên tối ưu hóa lựa chọn mô hình hình ảnh với chi phí và hiệu suất tối ưu.
Bối cảnh UAV ngày càng yêu cầu tính năng tự động hóa với navigation và perception chạy onboard. Nguyên nhân kỹ thuật là do các thiết kế truyền thống không đáp ứng được constraints về SWaP (Size, Weight, and Power). Hệ quả là các nhà thiết kế phải tối ưu hóa lại cách tính toán, cảm biến và phần mềm hoạt động trong môi trường hạn chế. Điều đáng học là bài viết trình bày các phương pháp tối ưu hóa compute architecture cho UAV, bao gồm cả việc sử dụng các công nghệ như NVIDIA Jetson series để đạt được hiệu năng cao trong điều kiện SWaP bị giới hạn.
Bài viết này giúp lập trình viên hiểu cách tối ưu hóa hiệu năng tính toán cho drone trong giới hạn SWaP khi phát triển hệ thống tự hành.
Ngành drone đã đạt cột mốc quan trọng khi hàng tỷ dữ liệu hình ảnh được tạo ra mỗi ngày từ các thiết bị bay. Việc xử lý theo lô (batch processing) truyền thống với tốc độ 30 khung hình/giây trở nên không đủ đáp ứng nhu cầu thời gian thực. Hệ quả là các hệ thống hiện tại thường bỏ lỡ 60-70% các sự kiện quan trọng do độ trễ xử lý. Công nghệ như NVIDIA Jetson và mô hình inference phân tán (distributed inference) cần được áp dụng để đạt tốc độ xử lý 120+ khung hình/giây. Điều đáng học hỏi là chuyển từ kiến trúc centralized sang edge computing để giảm độ trễ từ hàng chục giây xuống dưới 100ms.
Bài viết giúp lập trình viên hiểu cách chuyển đổi từ xử lý batch sang xử lý thời gian thực trong thị trường drone đang bùng nổ.
AIMORELOGY Ovis là module AI vision camera open-source sử dụng chip CVITEK CV1842H-P SoC, hỗ trợ full-color 1080p night vision và có khả năng xử lý AI 1.5 TOPS tại edge. Module này được thiết kế để hoạt động hiệu quả trong điều kiện thiếu sáng nhờ công nghệ night vision độc quyền. Với hiệu năng xử lý 1.5 TOPS, Ovis có khả năng chạy các tác vụ AI phức tạp ngay tại thiết bị đầu cuối mà không cần kết nối đến cloud. Dự án đang được gây quỹ crowdfunding, cho thấy cộng đồng công nghệ quan tâm đến giải pháp AI vision tại edge. Lập trình viên nên đọc bài gốc để tìm hiểu chi tiết về cách triển khai AI-ISP và tích hợp night vision vào hệ thống camera thông minh.
Module camera Ovis mang lại khả năng thị giác AI với đêm màu full HD và xử lý edge AI mạnh mẽ 1.5 TOPS cho các dự án IoT thông minh.
Bài quiz này giúp bạn kiểm tra kiến thức về face detection với Python, tập trung vào các khái niệm cốt lõi của phương pháp traditional face detection. Nội dung bao gồm Haar-like features, integral images - kỹ thuật tối ưu hóa tính toán cho việc trích xuất đặc trưng từ ảnh. AdaBoost được sử dụng để chọn lọc các features quan trọng nhất, trong khi cascading classifiers giúp tăng tốc độ phát hiện mặt bằng cách loại bỏ các vùng không có khuôn mặt sớm. Nếu bạn đã đọc về phương pháp này và muốn củng cố kiến thức, bài quiz này sẽ là cơ hội tốt để kiểm tra lại các thuật toán và nguyên lý kỹ thuật quan trọng.
Bài quiz giúp củng cố kiến thức về nhận diện khuôn mặt với Python qua các khái niệm quan trọng như Haar-like features, integral images, AdaBoost và cascading classifiers.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử