The last post identified potential transition pathways for truck drivers based on how closely other occupations matched them on skills, abilities and knowledge. This post follows the same basic approach across a wider range of occupations and asks whether two proxies could stand in for the ratings where no ONET exists: a small language model comparing the meaning of job descriptions and the distance between two jobs' US Standard Occupational Classification (SOC) codes. The post ONET ratings, job descriptions and classification codes as measures of occupational similarity appeared first on Giles.
Nguồn: https://www.r-bloggers.com/2026/09/onet-ratings-job-descriptions-and-classification-codes-as-measures-of-occupational-similarity. 8 Sync News chỉ tóm tắt và dẫn link; bản quyền nội dung thuộc tác giả và nguồn gốc.
Đang tải bình luận…
Các tập dữ liệu công cộng như CDC dataset đôi khi chứa hidden target leakage khiến mô hình học máy đạt điểm số không thực tế. Tác giả đã phát hiện vấn đề khi mô hình dự đoán cột dữ liệu thứ sáu với R² lên đến 0.998 bất thường. Python cùng dependency graph là công cụ hữu hiệu để vạch ra mối quan hệ ẩn giữa các features và target variable. Bài viết hướng dẫn cách xây dựng dependency graph để phát hiện và loại bỏ leakage, giúp tránh overfitting trong production model.
Bài viết này giúp phát hiện rò rỉ mục tiêu ẩn trong bộ dữ liệu công khai bằng Python và đồ thị phụ thuộc để tránh tạo ra các mô hình machine learning giả tạo.
Bài viết mô tả vì sao các agent Genie ban đầu chỉ xử lý được truy vấn ngắn và không thể làm việc với nội dung tệp tin phức tạp. Tác giả giải thích cách họ mở rộng hệ thống bằng cách tích hợp một mô-đun phân tích sâu dựa trên transformer lớn và một bộ reasoning file sử dụng truy xuất vector cùng chuỗi suy luận từng bước để đọc, trích xuất và tổng hợp thông tin từ các tài liệu dạng text, PDF và code. Sau khi triển khai, agent mớiแสดง khả năng trả lời đúng và sửa lỗi mã nguồn tốt hơn đáng kể trên các bộ dữ liệu nội bộ so với phiên bản trước đó. Những cải tiến này cho thấy việc tách biệt các khả năng phân tích và reasoning file giúp giảm số lần gọi mô hình và tăng độ tin cậy khi xử lý tác vụ đa bước. Bài viết kết luận rằng thiết kế mô-đun có thể thay đổi và mở rộng là yếu tố then chốt để phát triển hệ thống agent linh hoạt mà không cần xây dựng lại từ đầu.
Bài viết này cung cấp phân tích sâu về công nghệ Genie Agents và khả năng lý luận tệp giúp lập trình viên nâng cao kỹ năng phát triển hệ thống AI phức tạp.
Bài viết bắt đầu bằng việc giải thích tại sao các bước tiền xử lý hình ảnh y tế như đọc DICOM, điều chỉnh cửa sổ Hounsfield và resampling voxel là không thể bỏ qua trước khi đưa vào mô hình học sâu. Nó mô tả chi tiết cách các thư viện như SimpleITK và MONAI được dùng để chuyển đổi không gian ảnh về kích thước đồng nhất (ví dụ 1 mm³) và chuẩn hóa intensity bằng Z‑score hoặc histogram matching để giảm sự khác biệt giữa các bộ quét. Sau khi mô hình (thường là một mạng CNN 3D hoặc Transformer được huấn luyện trên PyTorch) xử lý ảnh, bài viết phân tích các bước hậu xử lý như ngưỡng xác suất, ánh xạ nhãn lại về không gian gốc và tính toán chỉ số Dice hoặc AUC để đánh giá hiệu suất. Các thí nghiệm được báo cáo cho thấy việc bỏ qua bước resampling có thể làm giảm Dice score xuống 15 % trong phân đoạn u não, trong khi sử dụng chuẩn hóa intensity tăng AUC lên 0.92 so với 0.84 khi không chuẩn hóa. Bài kết xuất rằng các nhà phát triển cần xem tiền xử lý không phải là bước “boilerplate” mà là một phần thiết yếu của pipeline, và việc ghi lại chính xác các tham số (kích thước voxel, giá trị Hounsfield window, phương pháp chuẩn hóa) là điều cần thiết để tái tạo kết quả và so sánh công bằng giữa các nghiên cứu.
Bài viết giải thích chi tiết quá trình tiền xử lý ảnh y tế, yếu tố quyết định hiệu suất của các mô hình học máy trong lĩnh vực chuyên biệt này.
Bài báo "Dự báo lợi nhuận cổ phiếu zero-shot bằng mạng RVFL đã tiền huấn luyện" được chấp nhận đăng tại hội nghị COPA 2026. Mã nguồn và liên kết bài báo đã được công bố.
Lập trình viên chuyên về phân tích dữ liệu hoặc AI, đặc biệt là trong lĩnh vực dự đoán thị trường tài chính, nên đọc bài này để khám phá cách sử dụng mạng lưới RVFL (Randomized Variational Feature Learning) đã được pretrain để dự đoán kết quả thị trường một cách hiệu quả mà không cần dữ liệu huấn luyện trước (zero-shot), giúp tối ưu hóa hiệu suất và ứng dụng trong các dự án thực tế.
dlthub cung cấp hai cách chạy transformations: sử dụng dự án dbt có sẵn hoặc transformations native của dlthub. Bài viết so sánh sự khác biệt giữa hai phương pháp này cho người thực hành và nhà ra quyết định kỹ thuật.
Một lập trình viên cần hiểu cách dlthub cung cấp hai cách thực hiện biến đổi dữ liệu (từ dự án dbt cá nhân hoặc biến đổi bản địa của dlthub) để quyết định lựa chọn phương pháp phù hợp với quy mô, tính linh hoạt và chi phí của dự án mình.
R For SEO Part 10: SEO Reporting With Google Sheets & OpenRouter Welcome back, and we’re finally at the end of my R for SEO series, at least for now. We’ve gone through quite... This post was written by Ben Johnston on Ben Johnston
Dear rOpenSci friends, it’s time for our monthly news roundup! You can read this post on our blog. Now let’s dive into the activity at and around rOpenSci! rOpenSci HQ Champions Program update Our Champions are making great progress! 🌟...
Chain-Ladder reserving in polars, validated against R and Whittaker-Henderson smoothing for a difficult development pattern.
Đọc tin ở đây, luyện code, học theo lộ trình và luyện IELTS trên các sản phẩm anh em — tất cả kết nối với nhau trong hệ sinh thái 8 Sync.
Cổng chính của hệ sinh thái: giới thiệu sản phẩm, blog và bảng giá trọn bộ.
Khám pháHọc theo lộ trình rõ từng chặng: video, quiz chấm tự động, certificate và mentor đang làm nghề.
Xem lộ trình1.000+ bài DSA, đề tiếng Việt, chấm tự động 7 ngôn ngữ — nhiều bài FREE, chạy ngay trên trình duyệt.
Luyện miễn phíChấm bốn kỹ năng IELTS bằng AI, phản hồi chi tiết theo rubric.
Dùng thử miễn phíAI IDE 22 MB cho dev Việt.
Tải miễn phíBộ nhớ tổ chức cho AI agent.
Khám pháAI trực Fanpage, tự sàng lọc lead.
Dùng thử