On programming, statistics, and Java
With love, to my dear girlfriend who loves my nerdiness
Latest developer news about statistics, summarized in Vietnamese by AI.
With love, to my dear girlfriend who loves my nerdiness
Three hundred twenty-nine new packages were submitted to CRAN in July. Here are my Top 40 picks in nineteen categories: Agriculture, Artificial Intelligence, Climate Studies, Computational Methods, Ecology, Epidemiology, Genomics, Machine Learni...
Tình huống test-driven development (TDD) khiến nhiều lập trình viên sa lầy vào việc pass test case mà quên mục tiêu thực sự. Nguyên nhân kỹ thuật nằm ở việc các test quá chi tiết, ví dụ như test "Happy path" chiếm 62% total test cases khiến design system bị méo mó. Hệ quả là codebase trở nên cứng nhắc, khó maintain và không phản ánh đúng business requirements. Bài viết nhấn mạnh bài học quan trọng: test nên tập trung vào hành vi hệ thống thay vì các implementation details, tránh việc tạo ra "false positives" trong test coverage.
Bài viết này giúp lập trình viên hiểu được cách phản hồi hiệu quả hơn từ bảng điểm thay vì chỉ tập trung vào kết quả cuối cùng.
Introduction Data Friedman test Aim and hypotheses Assumptions In R With base R With the {rstatix} package Interpretations Post-hoc tests Pairwise Wilcoxon signed-rank tests Nemenyi test Conover test Combination of statistical results and plo...
Bài viết so sánh hiệu quả của bootstrap so với các giả định quy ước về tính chuẩn của ước lượng. Tác giả kiểm tra các phân phối lệch mạnh để xem xét khi nào kích thước mẫu cần lên tới hàng chục nghìn để có phân phối chuẩn của mẫu trung bình. Kết quả cho thấy bootstrap hoạt động hiệu quả ngay cả với các phân phối cực kỳ lệch, trong khi các phương pháp truyền thống thất bại khi mẫu nhỏ. Điều này hữu ích cho lập trình viên khi xử lý dữ liệu phi thông thường và thiết kế các thuật toán thống kê robust.
Bài này giúp lập trình viên hiểu khi nào thống kê cổ điển không còn phù hợp với dữ liệu thực tế và cách Bootstrap giải quyết vấn đề đó.
Bài viết giải thích tại sao tư duy thực tế của chúng ta hướng đến Bayesian statistics trong khi hệ thống giáo dục lại dạy Frequentist approach. Tác giả trình bày cách xác suất không có giá trị thực trên chocolate bar đến ứng dụng trong marketing mix model sử dụng PyMC. Bài viết chỉ ra sự khác biệt giữa hai phương pháp khi phải tính xác suất mà không có dữ liệu lịch sử, nhấn mạnh công thức Bayes theorem từ thế kỷ 18. Điều đáng học là cách suy nghĩ theo giúp chúng ta đưa ra quyết định tốt hơn trong điều kiện thiếu thông tin, được minh họa bằng ví dụ thực tế về xác định giá bán sản phẩm.
Bài này giúp bạn hiểu sự khác biệt tư duy Bayesian và Frequentist qua ví dụ thực tế từ đơn giản đến phức tạp.
Bối cảnh của bài viết là vấn đề linear regression bị ảnh hưởng bởi outliers, một thách thức lớn trong phân tích dữ liệu thực tế. Nguyên nhân kỹ thuật nằm ở phương pháp OLS (Ordinary Least Squares) tối thiểu hóa tổng bình phương residuals, khiến các giá trị ngoại lai có sức ảnh hưởng quá lớn đến mô hình. Hệ quả là mô hình có thể có bias cao, giảm độ chính xác và độ tin cậy của dự báo. Điều đáng học là bài viết trình bày so sánh các phương pháp robust estimation như Huber, RANSAC và Theil-Sen, cùng với code ví dụ và kết quả thực nghiệm về hiệu suất của từng phương pháp khi xử lý dữ liệu có outliers.
Bài viết này giúp lập trình viên hiểu cách xử lý điểm ngoại lệ trong hồi quy tuyến tính để xây dựng mô hình dự báo đáng tin cậy hơn.
Trong các mô phỏng thống kê, số ngẫu nhiên được tạo ra bởi máy tính thực chất là pseudorandom numbers - dãy số có quy luật được tạo bằng thuật toán như Mersenne Twister. Nguyên nhân kỹ thuật nằm ở bản chất xác định của máy tính: chúng không tạo ra số ngẫu nhiên thực sự mà chỉ mô phỏng ngẫu nhiên thông qua các hàm số có thể dự đoán nếu biết seed. Hệ quả là các kết quả Monte Carlo vẫn đáng tin cậy vì chúng hội tụ về xác suất lý thuyết khi số mẫu đủ lớn, dù mỗi lần chạy lại cho kết quả giống nhau nếu giữ nguyên seed. Bài viết giải thích tại sao method này vẫn hiệu quả bất chấp giả định về tính ngẫu nhiên, và điều đáng học là việc hiểu cách pseudorandom number generator hoạt động giúp kiểm soát và tái tạo kết quả phân tích.
Bài viết giải thích tại sao phương pháp Monte Carlo vẫn hiệu quả ngay cả khi số ngẫu nhiên trong mô phỏng không thực sự ngẫu nhiên.
Bối cảnh bài hướng dẫn cách sử dụng Grubbs' test trong R qua hàm grubbs.test() từ package outliers. Nguyên nhân kỹ thuật bài cung cấp ví dụ thực tế với dataset mtcars, bao gồm giá trị G, U và p-value cụ thể. Hệ quả sau khi test phát hiện giá trị ngoại lai, bài giải thích cách xử lý tiếp theo. Điều đáng học là bài minh họa rõ ràng việc áp dụng test thống kê phát hiện điểm dữ liệu bất thường trong phân tích dữ liệu thực tế.
Bài hướng dẫn thực tế về Grubbs' test trong R giúp bạn phát hiện và xử lý giá trị ngoại lệ một cách chính xác.
How statistical moments connect the mean, the variance, and higher powers of a distribution
Vào tháng năm nhiệt độ Delhi tăng trên 40°C dẫn đến doanh số bán điều hòa không khí tăng đột biến. Nguyên nhân kỹ thuật là hoạt động của AC làm tăng nhiệt độ môi trường do tỏa nhiệt từ quá trình nén và giải phóng khí làm lạnh. Hệ quả là hiệu ứng đảo ngược nơi việc sử dụng nhiều AC góp phần làm nhiệt độ đô thị tăng cao hơn nữa. Bài viết minh họa nguyên lý Second Law of Thermodynamics trong bối cảnh thực tế với con số cụ thể về nhiệt độ Delhi và tác động của hệ thống AC lên urban heat island effect. Đây là bài học quan trọng về cách nhận thức sai về quan hệ nhân quả trong các hệ thống phức hợp mà lập trình viên nên cân nhắc áp dụng khi thiết kế hệ thống phân tán.
Bài viết giúp lập trình viên nhận ra những hiểu nhầm về quan hệ nhân quả trong lập trình và ra quyết định tốt hơn.
Switchback experiments đã trở thành thiết kế phổ biến cho thử nghiệm marketplace tại các nền tảng lớn như DoorDash, Lyft, Uber. Bài viết chỉ ra rằng hầu hết các phép tính power (quyết định kích thước mẫu) cho switchback experiments đều sai do không xét đến yếu tố nhiễu time effect. Nguyên nhân kỹ thuật là các công thức power calculation hiện tại giả định các độc lập thống kê giữa các observations, trong khi thực tế có correlation do yếu tố thời gian. Hệ quả là nhiều nghiên cứu kết luận sai lệch về hiệu quả của các thay đổi, dẫn đến quyết định kinh doanh không đáng tin cậy. Điều đáng học là cần sử dụng các phương pháp power calculation mới tính đến correlation time effect như proposed trong bài để có kết quả experiment chính xác.
Bài viết này giúp lập trình viên hiểu và sửa lỗi sai trong tính toán công suất cho thí nghiệm Switchback, một phương pháp thiết kế phổ biến trong các nền tảng thị trường kỹ thuật số.
Frequentist confidence intervals and Bayesian credible intervals answer different questions, and confusing them can distort product decisions
Bài viết hướng dẫn thực tế về phát hiện và xử lý outlier trong Python dành cho sinh viên khoa học dữ liệu, sử dụng phương pháp IQR và Z-score với các kiểm tra dữ liệu an toàn. Nguyên nhân kỹ thuật là outlier có thể gây sai lệch kết quả phân tích, tác động đáng kể đến mô hình machine learning. Hệ quả cụ thể là mô hình có thể giảm độ chính xác tới 30-40% nếu không xử lý outlier, đặc biệt trong các thuật toán như Linear Regression hoặc K-means. Điều đáng học là bài cung cấp code mẫu minh họa từng bước xử lý outlier bằng thư viện NumPy và Pandas, giúp lập trình viên triển khai ngay vào dự án.
Bài hướng dẫn thực tế này cung cấp phương pháp hiệu quả để phát hiện và xử lý giá trị ngoại lai trong Python bằng IQR và Z-score, giúp bạn làm việc với dữ liệu an toàn và chính xác hơn.
Trong lĩnh vực data science, các lập trình viên thường mắc phải 10 sai số thống kê phổ biến khi phân tích dữ liệu. Các lỗi này phát sinh do hiểu sai về định nghĩa p-value, kết hợp sai ANOVA với multiple comparisons, hoặc diễn giải nhầm correlation coefficient. Hậu quả là những kết luận sai lệch dẫn đến quyết định kinh doanh dựa trên dữ liệu không đáng tin cậy. Những bài học đắt giá nhất là việc luôn kiểm định giả thuyết một cách cẩn trọng và sử dụng các công cụ như Bootstrap để giảm thiểu sai số trong phân tích thống kê.
Bài viết này giúp lập trình viên tránh các sai sót thống kê phổ biến khi phân tích dữ liệu và đưa ra quyết định.
Over the last few years there has been great interest in Bayesian inference for A/B testing, and many commercial experimentation platforms now offer Bayesian A/B testing. , , , , , , , and , all ship a Bayesian mode. The main argument is that it is modern, flexible and easier to interpret compared to frequentist statistics. In addition, it is often claimed that many of the frequentist complexities like multiple testing and sequential testing fall out naturally in the Bayesian way of thinking. In this blog post, we argue that there is a theme of oversimplification that frequently leads to bad inference practice that is no better than peeking in frequentist statistics. In statistics, details matter.
Check your understanding of descriptive statistics in Python, from means and spread to correlation, summaries, and plots that reveal your data.
Khi triển khai A/B testing với treatment và control có chi phí khác nhau, việc chia traffic 50/50 như mặc định không tối ưu. Phương pháp cost-based sampling weights cho phép phân bổ traffic cân bằng về mặt thống kê nhưng có thể điều chỉnh dựa trên chi phí thực tế. Việc này giúp giảm chi phí tổng thể lên đến 37% khi treatment đắt hơn trong nghiên cứu của Facebook. Lập trình viên nên cân nhắc áp dụng phương pháp sampling weights để tối ưu hóa ngân sách testing trong các hệ thống current search ranking.
Bài viết này giúp lập trình viên tối ưu phân bổ ngân sách kiểm thử khi các biến thể có chi phí khác nhau.
Dual Lab, một thành viên współpracadora của PDF Association, đã phân tích toàn bộ bộ dữ liệu PDF trong June 2026 Common Crawl covering the years 2006‑2025 để xem xu hướng kích thước tệp theo thời gian. Nghiên cứu cho thấy sự tăng trưởng đáng kể của kích thước trung bình, chủ yếu do việc nhúng hình ảnh độ phân giải cao, font không được subset và lượng metadata thừa trong các tệp PDF hiện đại. Hệ quả của xu hướng này là các tệp PDF tốn nhiều dung lượng lưu trữ hơn, làm chậm quá trình tải xuống và tăngภาร� băng thông, đặc biệt trên các thiết bị có bộ nhớ hạn chế hoặc kết nối chậm. Điều đáng học là các nhà phát triển nên tối ưu hoá hình ảnh trước khi nhúng, sử dụng font subset, bật linearization và nén nội dung để kiểm soát kích thước mà không làm giảm chất lượng hiển thị. Việc áp dụng những biện pháp này giúp duy trì lợi thế của PDF dưới dạng định dạng phổ biến mà vẫn giữ hiệu suất tốt.
Bài viết giải thích rõ nguyên nhân và xu hướng tăng kích thước PDF từ năm 2006 đến 2025, giúp lập trình viên hiểu cách tối ưu hóa công cụ xử lý PDF trong ứng dụng của mình để giảm thiểu chi phí lưu trữ và tốc độ tải nhanh hơn.
Complete guide to running one-sample and two-sample Z-tests in R using BSDA::z.test(), the manual pnorm/qnorm method, and how to choose between a Z-test and a t-test for your data. Read More »
A practical tour of one of the most expressive distribution charts — and how to make it your own with a few configuration flags. Boxplots are the workhorse of exploratory data analysis. They’re…
The hidden assumptions behind the data we observe.
Bài viết hướng dẫn thực hiện repeated measures ANOVA trong R, một phương pháp thống kê quan trọng cho dữ liệu đo lặp lại. Phân tích này yêu cầu kiểm tra các giả định quan trọng như normality, sphericity (được kiểm tra bằng test Mauchly) và phát hiện outliers. Bạn có thể thực hiện test với cả {rstatix} package và base R, nhưng {rstatix} cung cấp giao diện trực quan hơn với hàm get_anova_table(). Kết quả cần được kết hợp với post-hoc tests như Tukey HSD khi có hiệu ứng thống kê quan trọng (p < 0.05) để xác định cụ thể nhóm nào khác biệt.
Bài hướng dẫn này giúp lập trình viên thực hiện và hiểu sâu về Repeated measures ANOVA trong R, một phương pháp thống kê quan trọng cho dữ liệu lặp lại.
Bài viết giải thích cơ bản về các phân phối xác suất PMF, PDF và CDF để lượng hóa sự không chắc chắn. Nguyên nhân kỹ thuật là các hàm này khác nhau: PMF (Probability Mass Function) cho biến rời rạc, PDF (Probability Density Function) cho liên tục, và CDF (Cumulative Distribution Function) tổng hợp xác suất. Hệ quả là hiểu rõ các khái niệm này giúp xử lý dữ liệu và xây dựng mô hình thống kê hiệu quả. Đáng học là bài viết cung cấp ví dụ minh họa cụ thể về cách áp dụng từng loại hàm trong thực tế phân tích dữ liệu.
Bài viết này giúp lập trình viên nắm vững các khái niệm xác suất cơ bản để phân tích dữ liệu hiệu quả.
Bài viết đưa ra bối cảnh rằng các mô hình hồi quy truyền thống thường giả định dữ liệu đầy đủ và gặp khó khăn khi có giá trị bị thiếu hoặc biến ẩn. Nguyên nhân kỹ thuật được nêu là việc áp dụng thuật toán Expectation‑Maximization (EM) như một khung tối ưu hóa lặp lại, trong đó bước E tính toán kỳ vọng của likelihood đầy đủ và bước M tối ưu hóa tham số dựa trên kỳ vọng đó. Hệ quả của việc này là các ước lượng tham số trở nên ổn định hơn trong presenza của dữ liệu không quan sát được, đồng thời cho phép mở rộng hồi quy sang các mô hình có biến ẩn như miesz hợp Gaussian hoặc mô hình yếu tố. Tuy nhiên, bài cũng chỉ ra rằng EM có thể hội tụ tới cực đại địa phương và phụ thuộc nghiêm trọng vào việc khởi tạo ban đầu. Điều đáng học là khi xử lý hồi quy với dữ liệu thiếu hoặc cấu trúc ẩn, nên cân nhắc sử dụng EM nhưng phải kiểm tra nhiều điểm khởi tạo và theo dõi tiêu chí hội tụ để tránh kết quả không tin cậy.
Bài viết này giúp bạn hiểu sâu về áp dụng thuật toán EM trong mô hình hồi quy qua lăng kính tối ưu hóa lặp.
Bài viết giới thiệu phân tích sự sống trên bộ dữ liệu Rossi recidivism bằng Python và thư viện lifelines. Nó giải thích khái niệm censura, hàm sinh tồn S(t) và hàm nguy cơ h(t), sau đó ước lượng đường cong sinh tồn bằng Kaplan‑Meier và mô hình Cox proportional hazards để tính hazard ratio của các biến như financial aid, age, prior convictions. Khi kiểm tra giả định nguy cơ tỷ lệ thuận bằng dư lượng Schoenfeld, mô hình phát hiện vi phạm cho tuổi và kinh nghiệm làm việc, dẫn đến ước lượng bias nếu không xử lý. Tác giả đề xuất các biện pháp khắc phục: stratify theo biến vi phạm, thêm hiệu ứng thay đổi theo thời gian hoặc điều chỉnh dạng hàm của biến. Bài học chính là phải luôn kiểm tra giả định Cox, hiểu censura và hazard ratio, và sử dụng công cụ chẩn đoán như dư lượng Schoenfeld trước khi suy diễn từ mô hình.
Hướng dẫn này giúp lập trình viên nắm bắt survival analysis và mô hình Cox Proportional Hazards từ cơ bản đến thực tế với Python.
Bài viết giới thiệu cách thực hiện kiểm định McNemar (McNemar’s test) trong R để đánh giá mối quan hệ giữa hai biến định tính dựa trên dữ liệu cặp đôi. Kiểm định này thường được sử dụng thay cho Chi-square test khi dữ liệu có cấu trúc lặp (matched pairs).
Một lập trình viên nên đọc bài này để học cách thực hiện McNemar’s test trong R, một kỹ thuật thống kê quan trọng cho việc phân tích sự thay đổi giữa hai trạng thái tương tự (như kết quả trước/ sau điều trị), đặc biệt hữu ích khi dữ liệu được tổ chức dưới dạng bảng đối lập hai hàng hai cột.
Khi chạy nhiều thí nghiệm A/B, cộng dồn từng thắng lợi cá nhân thường làm tăng lên tác động thực tế vì các hiệu ứng chồng lấn và tương tác giữa các thay đổi. Bài viết chỉ ra hai cách đo lường tác động tích lũy chính xác: sử dụng nhóm holdout (control group) riêng biệt và phương pháp Cumulative Impact của Datadog. Holdout hoạt động bằng cách giữ một phần người dùng không tham gia bất kỳ thí nghiệm nào, sau đó so sánh chỉ số tổng thể của nhóm này với nhóm đã áp dụng tất cả thay đổi. Cumulative Impact của Datadog tính toán tác động tổng thể bằng việc mô phỏng việc áp dụng tuần tự các thay đổi và điều chỉnh dựa trên độ phụ thuộc giữa chúng, thường được biểu thị bằng phần trăm tăng trưởng chỉ số KPI. Để chọn phương pháp, nếu bạn có thể dành một phần traffic làm holdout và muốn đo lường tác động thực tế trên sản phẩm, hãy dùng holdout; nếu không thể tách traffic hoặc cần xem tác động của từng thí nghiệm trong bối cảnh đã áp dụng các thí nghiệm trước, hãy chọn Cumulative Impact của Datadog.
Bài viết giúp lập trình viên hiểu phương pháp đo lường tác động thực sự của experiment thay vì tổng hợp các kết quả riêng lẻ.
Read the news here, practice coding, follow structured courses and train for IELTS on our sibling products — all connected through one 8 Sync account.
The ecosystem home: product overviews, blog and full pricing.
ExploreLearn along a clear roadmap: videos, auto-graded quizzes, certificates and mentors who ship for a living.
View the roadmap1,000+ DSA problems in Vietnamese, auto-graded across 7 languages — many FREE, right in your browser.