From a chocolate bar with no price tag to a marketing mix model in PyMC, and the 200-year-old integral that stood in between.
Source: https://towardsdatascience.com/why-you-think-like-a-bayesian-but-were-taught-like-a-frequentist. 8 Sync News only summarizes and links out; content copyright belongs to the authors and original sources.
Các dự đoán từ LLM có thể thay thế kết quả con người trong A/B tests, nhưng chỉ dựa trên giả định chứ không phải thiết kế sẵn. Khi áp dụng trên bộ dữ liệu Upworthy, việc hiệu chỉnh đầu ra LLM theo dữ liệu người thật đã khôi phục hiệu ứng điều trị, nhưng chỉ với phương pháp cụ thể. Những điều kiện giúp điều này hoạt động không thể xác minh cho các thử nghiệm mới và càng kém thuyết phục khi phương pháp mới khác xa các thử nghiệm trước. Lợi ích tiềm năng càng lớn thì độ tin cậy càng thấp.
Lập trình viên nên đọc bài này để hiểu cách các mô hình ngôn ngữ lớn (LLM) có thể thay thế phân tích A/B test truyền thống bằng cách dự đoán kết quả người dùng, nhưng chỉ khi áp dụng với các điều kiện cụ thể và giới hạn, giúp họ đánh giá rủi ro khi tự động hóa quá trình này trong dự án.
Đang tải bình luận…
Today’s just a very short sequel to last week’s post, where I had a look at some very skewed distributions to test the idea that sample sizes sometimes need to be in the tens of thousands for the sample mean to have a normal distribution. Turns out the...
Run Grubbs' test in R with grubbs.test() from the outliers package. Verified mtcars example with real G, U, and p-value output, plus when the test applies and what to do after it flags a value. Read More »
How statistical moments connect the mean, the variance, and higher powers of a distribution
Robust Estimation Series: comparing classical and modern robust estimators through theory, code, and experiments
Frequentist confidence intervals and Bayesian credible intervals answer different questions, and confusing them can distort product decisions
Switchback experiments đã trở thành thiết kế phổ biến cho thử nghiệm marketplace tại các nền tảng lớn như DoorDash, Lyft, Uber. Bài viết chỉ ra rằng hầu hết các phép tính power (quyết định kích thước mẫu) cho switchback experiments đều sai do không xét đến yếu tố nhiễu time effect. Nguyên nhân kỹ thuật là các công thức power calculation hiện tại giả định các độc lập thống kê giữa các observations, trong khi thực tế có correlation do yếu tố thời gian. Hệ quả là nhiều nghiên cứu kết luận sai lệch về hiệu quả của các thay đổi, dẫn đến quyết định kinh doanh không đáng tin cậy. Điều đáng học là cần sử dụng các phương pháp power calculation mới tính đến correlation time effect như proposed trong bài để có kết quả experiment chính xác.
Bài viết này giúp lập trình viên hiểu và sửa lỗi sai trong tính toán công suất cho thí nghiệm Switchback, một phương pháp thiết kế phổ biến trong các nền tảng thị trường kỹ thuật số.
Khi chạy nhiều thí nghiệm A/B, cộng dồn từng thắng lợi cá nhân thường làm tăng lên tác động thực tế vì các hiệu ứng chồng lấn và tương tác giữa các thay đổi. Bài viết chỉ ra hai cách đo lường tác động tích lũy chính xác: sử dụng nhóm holdout (control group) riêng biệt và phương pháp Cumulative Impact của Datadog. Holdout hoạt động bằng cách giữ một phần người dùng không tham gia bất kỳ thí nghiệm nào, sau đó so sánh chỉ số tổng thể của nhóm này với nhóm đã áp dụng tất cả thay đổi. Cumulative Impact của Datadog tính toán tác động tổng thể bằng việc mô phỏng việc áp dụng tuần tự các thay đổi và điều chỉnh dựa trên độ phụ thuộc giữa chúng, thường được biểu thị bằng phần trăm tăng trưởng chỉ số KPI. Để chọn phương pháp, nếu bạn có thể dành một phần traffic làm holdout và muốn đo lường tác động thực tế trên sản phẩm, hãy dùng holdout; nếu không thể tách traffic hoặc cần xem tác động của từng thí nghiệm trong bối cảnh đã áp dụng các thí nghiệm trước, hãy chọn Cumulative Impact của Datadog.
Read the news here, practice coding, follow structured courses and train for IELTS on our sibling products — all connected through one 8 Sync account.
The ecosystem home: product overviews, blog and full pricing.
ExploreLearn along a clear roadmap: videos, auto-graded quizzes, certificates and mentors who ship for a living.
View the roadmap1,000+ DSA problems in Vietnamese, auto-graded across 7 languages — many FREE, right in your browser.
Practice for freeAI grading for all four IELTS skills with detailed rubric feedback.
Try it freeA 22 MB AI IDE for Vietnamese devs.
Download freeOrganizational memory for AI agents.
ExploreAI that staffs your Fanpage and qualifies leads for you.
Try it