Bài đăng mới nhất

Giá trị missing là gì? Tại sao giá trị missing lại quan trọng?

Trong mỗi kỹ thuật thống kê, chúng ta cần biết chắc là đang thao tác trên các quan sát hợp lý không có quan sát trống (non-missing) hay có tồn tại các giá trị trống – missing data. Dữ liệu trống – missing data tác động đến tính thiên chệch, hiệu quả của các ước lượng thống kê. Do vậy, hiểu và quản lý các vấn đề dữ liệu trống – missing data là một việc rất quan trọng trong bất kì loại phân tích thống kê nào. Xử lí hiệu quả vấn đề dữ liệu trống – missing data có thể nâng cao độ tin cậy và tính vững của kết quả ước lượng. Bài viết sẽ trình bày giới thiệu vấn đề dữ liệu trống – missing data từ khái niệm, cách mã hóa và trình bày các giá trị trống – missing data. Ngoài ra, phần này cũng đi sâu phân biệt listwise vs pairwise trong hồi quy và cách tạo biến gen vs egen trong trường hợp dữ liệu tồn tại missing.

Bài viết bên dưới sẽ giới thiệu và lý giải tầm quan trọng của các loại missing trong nghiên cứu.
https://vietlod.com/gioi-thieu-du-lieu-trong-missing-data

Các phương pháp xử lý missing

Nguồn gốc của dữ liệu missing có thể là các vấn đề ngẫu nhiên hoặc không ngẫu nhiên. Xét trên khía cạnh này, dữ liệu missing có thể được phân thành 3 loại thường gặp là missing hoàn toàn ngẫu nhiên (MCAR), missing ngẫu nhiên (MAR) và missing không phải là ngẫu nhiên.

Chúng ta không thể biết chắc 100% nguồn gốc gây ra missing. Rất nhiều phương pháp xử lý missing giả định rằng các missing có dạng MCAR, MAR nhưng dữ liệu thực tế của chúng ta thường là NMAR. Tuy nhiên, may mắn là các phương pháp xử lý MAR sử dụng dữ liệu missing NMAR vẫn cho kết quả tốt.

Bài viết bên dưới sẽ giới thiệu các phương pháp xử lí các giá trị missing thường gặp.
https://vietlod.com/phuong-phap-xu-ly-missing

Phương pháp thay thế lặp MI – Multiple Imputation

Phương pháp thay thế lặp – MI là phương pháp được sử dụng phổ biến và là phương pháp hiệu quả nhất trong số các phương pháp xử lí giá trị missing. Tuy nhiên, phương pháp thay thế lặp – MI lại tương đối phức tạp và khó hiểu. Tiếp nối phần trình bày ở bài 2 về các phương pháp xử lý missing, phần trình bày này sẽ đi sâu diễn giải chi tiết các bước thực hiện của phương pháp thay thế lặp – MI. Đây là phần nội dung quan trọng nhất trong 3 bài viết về dữ liệu missing và các phương pháp xử lí.

Phần nội dung trình bày khá dài, mời bạn tham khảo ở link bên dưới.
https://vietlod.com/phuong-phap-thay-the-lap-multiple-imputation

Tạo nhanh biến giả trên Stata

Biến giả được sử dụng rất thường xuyên trong các mô hình phân tích. Để tạo một biến giả, trên Stata chúng ta có rất nhiều công cụ hỗ trợ như inlist, inrange, cond hoặc lệnh recode. Đặc biệt trong trường hợp một biến giả là kết hợp của nhiều phép toán logic, ví dụ, tôi muốn tạo biến giả tên là dnb với ý nghĩa là vùng Đông Nam bộ bao gồm các tỉnh từ Bình Phước đến TpHCM. Mỗi tỉnh trong bộ dữ liệu của TCTK được gán cho một mã số từ 1 đến 63. Trong trường hợp này biến dnb sẽ bao gồm các tỉnh có mã số từ 45 – 50.

Nội dung bên dưới, tôi trình bày cách sử dụng các lệnh như inlist, inrange, cond và lệnh recode.

https://vietlod.com/tao-bien-gia-nhanh-tren-stata

Sử dụng các chỉ số dưới _n và _N trên Stata

Các chỉ số dưới _n và _N là các biến hệ thống của Stata. _n cho biết vị trí của quan sát hiện tại trong dữ liệu. Bạn có thể sử dụng _n để tạo một biến số thứ tự cho mỗi quan sát. Trong khi _n cho biết số thứ tự của mỗi quan sát thì _N chính là giá trị lớn nhất của _n. Nếu không có tùy chọn by thì _N chính là giá trị của _n cho quan sát cuối cùng.

Chúng ta cũng có thể sử dụng _n như các chỉ số dưới – vốn được sử dụng rất phổ biến trong các công thức thống kê. Các chỉ số dưới rất hữu ích trong các dữ liệu có cấu trúc phân cấp (hierarchical structures) hoặc các loại dữ liệu bảng hay dữ liệu thời gian.

Việc sử dụng _n và _N giúp cho việc xử lí và trích lọc các biến trên bộ dữ liệu khảo sát mức sống dân cư Việt Nam (VHLSS) trở nên rõ ràng và dễ dàng hơn. Bài viết bên dưới sẽ giới thiệu chi tiết về cách sử dụng các chỉ số dưới để tạo lập các biến liên quan đến mỗi thành viên trong hộ, đặc biệt là chủ hộ và các biến chung cho hộ dựa trên bộ dữ liệu VHLSS 2012.
https://drive.google.com/open?id=1Psa0UFxRZ9n_w4rDRfGT7uPKLDu2QPdy

Xử lí các dữ liệu có định dạng chuỗi trên Stata

Bên cạnh dữ liệu dạng số thì các dữ liệu có định dạng chuỗi và dữ liệu có định dạng thời gian là những định dạng dữ liệu được sử dụng phổ biến trong các phân tích thống kê. Mỗi định dạng dữ liệu khác nhau cần có những kỹ thuật xử lí khác nhau. Bài viết sau sẽ minh họa cách xử lí các dữ liệu có định dạng chuỗi trên Stata.

Ngoài các lệnh encode, egen hoặc destring để chuyển các biến dạng chuỗi thành dạng số để xử lí thì trong nhiều trường hợp chúng ta xử lí trực tiếp trên các biến dạng chuỗi. Ví dụ sau đây sẽ minh họa trường hợp này.
https://drive.google.com/open?id=1QdCrcTzVLGQEMDRZND4vg1Md_ycpSYAa

Tính toán xác suất trên Stata

Việc tính toán các giá trị xác suất là rất phổ biến trong các kiểm định hoặc phân tích thống kê. Thay vì sử dụng các bảng tra các phân phối thì làm thế nào trên Stata chúng ta có thể tính toán giá trị xác suất ứng với mỗi giá trị của các phân phối thường gặp như phân phối chuẩn, phân phối Chi – bình phương, phân phối Student, phân phối Fisher và các dạng phân phối khác. Hoặc ngược lại, từ mức ý nghĩa (xác suất) cho trước chúng ta tính toán giá trị của các phân phối trên như thế nào? Cũng như đôi khi chúng ta muốn tính toán nhanh các giá trị giai thừa, hoán vị, tổ hợp trên Stata thì làm thế nào? Bài viết sau sẽ minh họa cách chuyển đổi qua lại giữa giá trị xác suất – giá trị của phân phối và cách tính các phép toán thống kê cơ bản trên Stata.
https://drive.google.com/open?id=19I7J8NmvpPssxCqKwIpN1W9V0k8Zg7bl

Một số lưu ý khi sử dụng lệnh collapse trên Stata

Liên quan đến dữ liệu sau khi được gộp (collapsed) bằng câu lệnh collapse (sum) với các quan sát của biến có chứa missing. Điều này sẽ dẫn đến sự thiên chệch trong kết quả ước lượng. Bởi lệnh collapse (sum) và egen sum, hoặc rowsum sẽ chuyển các giá trị missing thành giá trị 0. Ngược lại collapse (mean) hoặc collapse (sd) sẽ trả về giá trị missing. Bài viết sau sẽ mô phỏng vấn đề này và cách khắc phục.
https://drive.google.com/open?id=14yNid6uZvaQvw7K-82L_ZsYXpWrY39EI

Làm thế nào để biết đầu tư công (DTC, tỷ USD) có lấn áp đầu tư tư nhân (DTTN, tỷ USD) trong mối quan hệ tăng trưởng kinh tế? Cách đơn giản nhất để giải quyết vấn đề này đó là sử dụng biến tương tác giữa DTC*DTNN. Đây là trường hợp tương tác giữa 2 biến liên tục trong hồi quy. Sự tương tác giữa 2 biến liên tục trong hồi quy là tương đối phức tạp, và khó giải thích hơn so với sự tương tác giữa 1 biến liên tục và 1 biến phân loại. Bài viết sau sẽ minh họa và giải thích sự tương tác giữa 2 biến liên tục trong hồi quy OLS.
http://vietlod.com/giai-thich-su-tuong-tac-2-bien-lien-tuc

Bên dưới là phần minh họa chi tiết cách tải 11 chỉ số kinh tế quan trọng của Việt Nam như GDP, chi tiêu hộ gia đình, chi tiêu chính phủ, xuất khẩu, nhập khẩu theo giá danh nghĩa và giá thực; chỉ số giá tiêu dùng (CPI), tỉ giá (cuối kì, bình quân trong kì), lãi suất (cho vay, tiền gửi) của Việt Nam trong thời gian từ 2000 đến 2014 (theo năm hoặc quý hoặc nữa năm) từ IMF.
http://vietlod.com/huong-dan-tai-du-lieu-imf

Author Name

Biểu mẫu liên hệ

Tên

Email *

Thông báo *

Được tạo bởi Blogger.