Bài đăng mới nhất

Để đo lường đúng các biến rất cần thiết phải xác định đúng thang đo. Các kiểu biến khác nhau đòi hỏi phải được đo lường theo những cách khác nhau. Có 4 loại thang đo thường được sử dụng trong phân tích dữ liệu là thang đo danh nghĩa (nominal), thang đo thứ bậc (ordinal), thang đo khoảng (Interval) và thang đo tỉ lệ (Ratio). Sử dụng linh hoạt các thang đo trong việc đo lường biến sẽ giúp người nghiên cứu tiếp cận và phân tích đối tượng tốt hơn. Các loại thang đo trên lần lượt được trình bày ở bên dưới.
https://vietlod.com/thang-do-phan-tich-du-lieu

Đo lường khuynh hướng tập trung của dữ liệu

Bài này sẽ giới thiệu sơ lược về các khái niệm cơ bản của thống kê dùng trong mô tả dữ liệu như các tham số đo lường xu hướng tập trung của dữ liệu (mean, median, mode). Để dễ hình dung, ta bắt đầu với ví dụ đơn giản sau:

Giả sử rằng bạn chạy 100 m trong 6 lần, mỗi lần chạy bạn dùng đồng hồ đo lại thời gian chạy (tính bằng giây) và kết quả 6 lần chạy của bạn gồm 6 giá trị (còn gọi là quan sát) như sau:
x={25.1, 21.2, 17.9, 23.0, 24.6, 19.5}
Dữ liệu này cho bạn biết những thông tin gì?

Tham khảo: https://vietlod.com/khuynh-huong-tap-trung-cua-du-lieu

Khuynh hướng phân tán của dữ liệu

Để biết xu hướng tập trung của dữ liệu ta dùng các tham số như Mean, Median, Mode. Tuy nhiên, một câu hỏi quan trọng nữa cần phải trả lời khi xem xét một chất lượng của mẫu là “làm sao đo lường sự biến thiên (hay sự phân tán) của dữ liệu trong mẫu?” Vì có thể 2 mẫu có cùng trung bình nhưng sự biến thiên của dữ liệu là khác nhau. Bài viết sau sẽ tiếp tục bài khuynh hướng tập trung của dữ liệu trình bày về khuynh hướng phân tán của dữ liệu.

Chúng ta có thể sử dụng các thống kê tứ phân vị (IQR), giá trị Min, Max, phương sai, độ lệch chuẩn để đo lường khuynh hướng phân tán của dữ liệu.

Tham khảo: https://vietlod.com/khuynh-huong-phan-tan-cua-du-lieu

Điểm dị biệt là gì? Có nên loại bỏ điểm dị biệt?

Các điểm dị biệt (outliers) là những điểm có giá trị khác xa so với phần còn lại của dữ liệu. Việc xác định giá trị của điểm dị biệt là chủ quan. Trong khi đó, có một vài tiêu chuẩn để xác định một điểm có phải là điểm dị biệt hay không.

Có hai loại điểm dị biệt – univariate (tạm dịch là dị biệt đơn lẻ) và multivariate outliers (dị biệt kết hợp).

Các điểm dị biệt được tìm thấy rất nhiều trong các nghiên cứu, nó có thể làm méo mó tính chuẩn hóa của dữ liệu, vậy chúng ta có nên loại bỏ các điểm dị biệt này không?

Tham khảo: https://vietlod.com/diem-di-biet-spss

Lọc quan sát – Nối dữ liệu

Quản lý dữ liệu hay đôi khi còn gọi đơn giản là lọc quan sát thường được thực hiện để chuẩn bị dữ liệu cho các mục đích nghiên cứu thỏa mãn các điều kiện cụ thể. Một số lệnh được sử dụng nhằm mục đích quản lý dữ liệu thường được sử dụng trên Stata được tổng hợp ở bảng bên dưới.

Giả sử bây giờ, chúng ta có 2 tập tin, một tập tin chứa thông tin cá nhân (được gọi là hsdemo) và một tập tin chứa thông tin các điểm kiểm tra (gọi là hstest) và chúng ta muốn hợp nhất các tập tin với nhau để phân tích. Để thực hiện điều này, đầu tiên, chúng ta cần phải mở, sắp xếp và lưu mỗi file dữ liệu. Mỗi file dữ liệu phải được sắp xếp theo cùng một biến. Tiếp theo, chúng ta sử dụng lệnh merge để hợp nhất hai file dữ liệu.

Tham khảo: https://vietlod.com/loc-quan-sat-stata

Kiểm tra dữ liệu nhập – Stata

Trước khi tiến hành thao tác và phân tích dữ liệu, rất cần thiết chúng ta phải kiểm tra dữ liệu. Bài viết sau sẽ tổng hợp một số lệnh phổ biến trên Stata được sử dụng để thực hiện quá trình kiểm tra dữ liệu này.

Câu lệnh codebook sẽ mô tả chi tiết hơn về thông tin của các biến. Ngoài các thông tin ở câu lệnh describe trên, lệnh codebook cho biết về khoảng giá trị (range), giá trị rỗng (missing), giá trị trùng (unique values) của các biến. Riêng đối với các biến liên tục thì lệnh codebook còn cho biết thông tin về giá trị trung bình (mean), độ lệch chuẩn (std. dev), phân vị (percentiles) của các biến.

Tham khảo: https://vietlod.com/kiem-tra-du-lieu-nhap-stata

Đồ thị phân tán – Stata

Đồ thị phân tán được sử dụng phổ biến để kiểm tra dữ liệu trong các phân tích thống kê. Nó cho biết dạng phân tán ngẫu nhiên của các biến phân tích trong tập dữ liệu. Thông qua đồ thị phân tán, nhà nghiên cứu có thể phát hiện xu hướng, cũng như các vấn đề liên quan đến khuyết tật của dữ liệu. Bài viết sẽ trình bày 10 loại đồ thị phân tán được sử dụng phổ biến trên phần mềm Stata.

Bảng tổng hợp 10 loại đồ thị phân tán bên dưới gồm 3 cột: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.

Tham khảo: https://vietlod.com/do-thi-phan-tan-stata

Đồ thị phân phối trên Stata

Các đồ thị phân phối (Distribution plots) rất hữu ích trong việc mô tả dạng phân phối của dữ liệu. Thông thường các đồ thị phân phối được sử dụng để hỗ trợ các kiểm định về tính chất phân phối của biến, cũng như là tính chất phân phối của phần dư. Trong đó, tính chất phân phối chuẩn của biến/phần dư là một trong những tính chất phân phối quan trọng nhất. Bài viết sẽ trình bày 20 dạng đồ thị phân phối quan trong được sử dụng phổ biến trên phần mềm Stata như histogram, boxplot, kdensity…

Bảng tổng hợp 20 loại đồ thị phân phối quan trọng được thể hiện trong 3 cột gồm: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.
https://vietlod.com/do-thi-phan-phoi-distribution-plots-stata

Các loại đồ thị thường được sử dụng trong phân tích hồi quy

Các đồ thị hồi quy (Regression fit plots) được sử dụng để kiểm tra độ phù hợp của các biến dự đoán trong phân tích hồi quy tuyến tính. MỘt loại đồ thị hồi quy được sử dụng phổ biến nhất là đồ thị tuyến tính giữa biến kết quả dự báo với các biến giải thích. Bài viết sẽ trình bày 15 dạng đồ thị phân được sử dụng phổ biến trên phần mềm Stata.

Bảng tổng hợp 15 loại đồ thị hồi quy quan trọng được thể hiện trong 3 cột gồm: cột đầu tiên chính là loại đồ thị, cột thứ 2 bao gồm dữ liệu được sử dụng minh họa cùng với câu lệnh thực hiện trên Stata, và cột cuối cùng là minh họa kết quả thực hiện.
https://vietlod.com/do-thi-hoi-quy-regression-fit-stata

Phân biệt gen vs egen, listwise vs pairwise deletion

Trong mỗi kỹ thuật thống kê, chúng ta cần biết chắc là đang thao tác trên các quan sát hợp lý (non-missing) hay có tồn tại các giá trị missing. Do vậy, hiểu và quản lý các giá trị missing là một việc rất quan trọng trong bất kì loại phân tích thống kê nào. Bài viết sẽ trình bày cách mã hóa và phân biệt listwise vs pairwise delection trong hồi quy và cách tạo biến gen vs egen trong trường hợp dữ liệu tồn tại missing.

Nội dung bên dưới sẽ làm rõ sự khác nhau giữa hai lệnh gen với egen; cũng như phương pháp listwise với pairwise trong quá trình tạo biến hay xử lí dữ liệu.
https://vietlod.com/phan-biet-gen-vs-egen-listwise-vs-pairwise-delection

Author Name

Biểu mẫu liên hệ

Tên

Email *

Thông báo *

Được tạo bởi Blogger.