Bài đăng mới nhất

Lọc quan sát – Nối dữ liệu

Quản lý dữ liệu hay đôi khi còn gọi đơn giản là lọc quan sát thường được thực hiện để chuẩn bị dữ liệu cho các mục đích nghiên cứu thỏa mãn các điều kiện cụ thể. Một số lệnh được sử dụng nhằm mục đích quản lý dữ liệu thường được sử dụng trên Stata được tổng hợp ở bảng bên dưới.

Giả sử bây giờ, chúng ta có 2 tập tin, một tập tin chứa thông tin cá nhân (được gọi là hsdemo) và một tập tin chứa thông tin các điểm kiểm tra (gọi là hstest) và chúng ta muốn hợp nhất các tập tin với nhau để phân tích. Để thực hiện điều này, đầu tiên, chúng ta cần phải mở, sắp xếp và lưu mỗi file dữ liệu. Mỗi file dữ liệu phải được sắp xếp theo cùng một biến. Tiếp theo, chúng ta sử dụng lệnh merge để hợp nhất hai file dữ liệu.

Tham khảo: https://vietlod.com/loc-quan-sat-stata

Kiểm tra dữ liệu nhập – Stata

Trước khi tiến hành thao tác và phân tích dữ liệu, rất cần thiết chúng ta phải kiểm tra dữ liệu. Bài viết sau sẽ tổng hợp một số lệnh phổ biến trên Stata được sử dụng để thực hiện quá trình kiểm tra dữ liệu này.

Câu lệnh codebook sẽ mô tả chi tiết hơn về thông tin của các biến. Ngoài các thông tin ở câu lệnh describe trên, lệnh codebook cho biết về khoảng giá trị (range), giá trị rỗng (missing), giá trị trùng (unique values) của các biến. Riêng đối với các biến liên tục thì lệnh codebook còn cho biết thông tin về giá trị trung bình (mean), độ lệch chuẩn (std. dev), phân vị (percentiles) của các biến.

Tham khảo: https://vietlod.com/kiem-tra-du-lieu-nhap-stata

Đồ thị phân tán – Stata

Đồ thị phân tán được sử dụng phổ biến để kiểm tra dữ liệu trong các phân tích thống kê. Nó cho biết dạng phân tán ngẫu nhiên của các biến phân tích trong tập dữ liệu. Thông qua đồ thị phân tán, nhà nghiên cứu có thể phát hiện xu hướng, cũng như các vấn đề liên quan đến khuyết tật của dữ liệu. Bài viết sẽ trình bày 10 loại đồ thị phân tán được sử dụng phổ biến trên phần mềm Stata.

Bảng tổng hợp 10 loại đồ thị phân tán bên dưới gồm 3 cột: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.

Tham khảo: https://vietlod.com/do-thi-phan-tan-stata

Đồ thị phân phối trên Stata

Các đồ thị phân phối (Distribution plots) rất hữu ích trong việc mô tả dạng phân phối của dữ liệu. Thông thường các đồ thị phân phối được sử dụng để hỗ trợ các kiểm định về tính chất phân phối của biến, cũng như là tính chất phân phối của phần dư. Trong đó, tính chất phân phối chuẩn của biến/phần dư là một trong những tính chất phân phối quan trọng nhất. Bài viết sẽ trình bày 20 dạng đồ thị phân phối quan trong được sử dụng phổ biến trên phần mềm Stata như histogram, boxplot, kdensity…

Bảng tổng hợp 20 loại đồ thị phân phối quan trọng được thể hiện trong 3 cột gồm: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.
https://vietlod.com/do-thi-phan-phoi-distribution-plots-stata

Các loại đồ thị thường được sử dụng trong phân tích hồi quy

Các đồ thị hồi quy (Regression fit plots) được sử dụng để kiểm tra độ phù hợp của các biến dự đoán trong phân tích hồi quy tuyến tính. MỘt loại đồ thị hồi quy được sử dụng phổ biến nhất là đồ thị tuyến tính giữa biến kết quả dự báo với các biến giải thích. Bài viết sẽ trình bày 15 dạng đồ thị phân được sử dụng phổ biến trên phần mềm Stata.

Bảng tổng hợp 15 loại đồ thị hồi quy quan trọng được thể hiện trong 3 cột gồm: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.
https://vietlod.com/do-thi-hoi-quy-regression-fit-stata

Phân biệt gen vs egen, listwise vs pairwise deletion

Trong mỗi kỹ thuật thống kê, chúng ta cần biết chắc là đang thao tác trên các quan sát hợp lý (non-missing) hay có tồn tại các giá trị missing. Do vậy, hiểu và quản lý các giá trị missing là một việc rất quan trọng trong bất kì loại phân tích thống kê nào. Bài viết sẽ trình bày cách mã hóa và phân biệt listwise vs pairwise delection trong hồi quy và cách tạo biến gen vs egen trong trường hợp dữ liệu tồn tại missing.

Nội dung bên dưới sẽ làm rõ sự khác nhau giữa hai lệnh gen với egen; cũng như phương pháp listwise với pairwise trong quá trình tạo biến hay xử lí dữ liệu.
https://vietlod.com/phan-biet-gen-vs-egen-listwise-vs-pairwise-delection

Giá trị missing là gì? Tại sao giá trị missing lại quan trọng?

Trong mỗi kỹ thuật thống kê, chúng ta cần biết chắc là đang thao tác trên các quan sát hợp lý không có quan sát trống (non-missing) hay có tồn tại các giá trị trống – missing data. Dữ liệu trống – missing data tác động đến tính thiên chệch, hiệu quả của các ước lượng thống kê. Do vậy, hiểu và quản lý các vấn đề dữ liệu trống – missing data là một việc rất quan trọng trong bất kì loại phân tích thống kê nào. Xử lí hiệu quả vấn đề dữ liệu trống – missing data có thể nâng cao độ tin cậy và tính vững của kết quả ước lượng. Bài viết sẽ trình bày giới thiệu vấn đề dữ liệu trống – missing data từ khái niệm, cách mã hóa và trình bày các giá trị trống – missing data. Ngoài ra, phần này cũng đi sâu phân biệt listwise vs pairwise trong hồi quy và cách tạo biến gen vs egen trong trường hợp dữ liệu tồn tại missing.

Bài viết bên dưới sẽ giới thiệu và lý giải tầm quan trọng của các loại missing trong nghiên cứu.
https://vietlod.com/gioi-thieu-du-lieu-trong-missing-data

Các phương pháp xử lý missing

Nguồn gốc của dữ liệu missing có thể là các vấn đề ngẫu nhiên hoặc không ngẫu nhiên. Xét trên khía cạnh này, dữ liệu missing có thể được phân thành 3 loại thường gặp là missing hoàn toàn ngẫu nhiên (MCAR), missing ngẫu nhiên (MAR) và missing không phải là ngẫu nhiên.

Chúng ta không thể biết chắc 100% nguồn gốc gây ra missing. Rất nhiều phương pháp xử lý missing giả định rằng các missing có dạng MCAR, MAR nhưng dữ liệu thực tế của chúng ta thường là NMAR. Tuy nhiên, may mắn là các phương pháp xử lý MAR sử dụng dữ liệu missing NMAR vẫn cho kết quả tốt.

Bài viết bên dưới sẽ giới thiệu các phương pháp xử lí các giá trị missing thường gặp.
https://vietlod.com/phuong-phap-xu-ly-missing

Phương pháp thay thế lặp MI – Multiple Imputation

Phương pháp thay thế lặp – MI là phương pháp được sử dụng phổ biến và là phương pháp hiệu quả nhất trong số các phương pháp xử lí giá trị missing. Tuy nhiên, phương pháp thay thế lặp – MI lại tương đối phức tạp và khó hiểu. Tiếp nối phần trình bày ở bài 2 về các phương pháp xử lý missing, phần trình bày này sẽ đi sâu diễn giải chi tiết các bước thực hiện của phương pháp thay thế lặp – MI. Đây là phần nội dung quan trọng nhất trong 3 bài viết về dữ liệu missing và các phương pháp xử lí.

Phần nội dung trình bày khá dài, mời bạn tham khảo ở link bên dưới.
https://vietlod.com/phuong-phap-thay-the-lap-multiple-imputation

Tạo nhanh biến giả trên Stata

Biến giả được sử dụng rất thường xuyên trong các mô hình phân tích. Để tạo một biến giả, trên Stata chúng ta có rất nhiều công cụ hỗ trợ như inlist, inrange, cond hoặc lệnh recode. Đặc biệt trong trường hợp một biến giả là kết hợp của nhiều phép toán logic, ví dụ, tôi muốn tạo biến giả tên là dnb với ý nghĩa là vùng Đông Nam bộ bao gồm các tỉnh từ Bình Phước đến TpHCM. Mỗi tỉnh trong bộ dữ liệu của TCTK được gán cho một mã số từ 1 đến 63. Trong trường hợp này biến dnb sẽ bao gồm các tỉnh có mã số từ 45 – 50.

Nội dung bên dưới, tôi trình bày cách sử dụng các lệnh như inlist, inrange, cond và lệnh recode.

https://vietlod.com/tao-bien-gia-nhanh-tren-stata

Author Name

Biểu mẫu liên hệ

Tên

Email *

Thông báo *

Được tạo bởi Blogger.