Thường là chưa đủ. Một nghiên cứu đơn lẻ chỉ là một mảnh ghép. Kết luận khoa học vững chắc thường đến từ nhiều nghiên cứu độc lập cho kết quả nhất quán, được tổng hợp và đánh giá một cách có hệ thống. Bài viết này giải thích vì sao một nghiên cứu mới hiếm khi đủ, tổng quan hệ thống và phân tích gộp giúp được gì, và vì sao ngay cả các công cụ này cũng không xóa hết mọi bất định.
Vì sao một nghiên cứu đơn lẻ hiếm khi đủ?
Vì kết quả của một nghiên cứu có thể không lặp lại được khi người khác làm lại. Năm 2015, một nhóm hợp tác quốc tế đã lặp lại 100 nghiên cứu tâm lý học từng được công bố trên các tạp chí uy tín. Trong nghiên cứu gốc, 97% cho kết quả có ý nghĩa thống kê. Khi làm lại, con số này chỉ còn 36% (Open Science Collaboration, 2015).
Điều này không có nghĩa các nghiên cứu gốc đều sai. Kết quả có thể khác nhau do may rủi thống kê, do mẫu nhỏ, hoặc do khác biệt nhỏ trong cách thực hiện. Nhưng nó cho thấy một kết quả cần được kiểm chứng lại trước khi được xem là chắc chắn.
Bạn có thể tham khảo cách kiểm tra từng nghiên cứu riêng lẻ trong bài Làm sao kiểm tra một nghiên cứu được chia sẻ trên mạng?.
Bài học từ hydroxychloroquine trong đại dịch Covid-19
Câu chuyện hydroxychloroquine là ví dụ rõ về giới hạn của một nghiên cứu sớm. Tháng 3/2020, một nghiên cứu nhỏ tại Pháp, với 20 bệnh nhân dùng thuốc, cho rằng hydroxychloroquine có thể giúp điều trị Covid-19. Nghiên cứu này được lan truyền rộng rãi (Cullinan, 2025).
Vài tháng sau, thử nghiệm ngẫu nhiên RECOVERY tại Vương quốc Anh so sánh 1.561 bệnh nhân dùng hydroxychloroquine với 3.155 bệnh nhân được chăm sóc thông thường. Tỷ lệ tử vong sau 28 ngày là 27,0% ở nhóm dùng thuốc và 25,0% ở nhóm chăm sóc thông thường. Thử nghiệm không tìm thấy lợi ích về tỷ lệ tử vong (RECOVERY Collaborative Group, 2020).
Hơn bốn năm sau, nghiên cứu ban đầu tại Pháp bị tạp chí rút lại. Lý do được nêu gồm các lo ngại về đạo đức nghiên cứu, cũng như những băn khoăn về phương pháp và kết luận do chính ba đồng tác giả đặt ra (Cullinan, 2025). Ví dụ này cho thấy quy mô và thiết kế nghiên cứu quan trọng thế nào, và một kết quả ban đầu gây chú ý có thể thay đổi khi có bằng chứng tốt hơn.
Tổng quan hệ thống và phân tích gộp giúp được gì?
Tổng quan hệ thống (systematic review) tìm kiếm và đánh giá toàn bộ các nghiên cứu về một câu hỏi theo một quy trình được định trước, thay vì chỉ chọn những nghiên cứu thuận lợi. Phân tích gộp (meta-analysis) là kỹ thuật thống kê gộp số liệu của nhiều nghiên cứu để có ước tính chính xác hơn.
Trong y học dựa trên bằng chứng, tổng quan hệ thống thường được đặt ở đỉnh tháp bằng chứng. Tuy nhiên, Murad và cộng sự đề xuất một cách nhìn tinh tế hơn: tổng quan hệ thống không hẳn là “tầng cao nhất”, mà là một lăng kính để nhìn, thẩm định và áp dụng các bằng chứng bên dưới (Murad et al., 2016). Nói cách khác, chất lượng của một tổng quan phụ thuộc vào chất lượng của các nghiên cứu mà nó tổng hợp. Vì sao các nghiên cứu được tổng hợp đôi khi cho kết quả khác nhau được giải thích trong bài Vì sao hai nghiên cứu có thể cho kết quả trái ngược nhau?.
Mức độ chắc chắn của bằng chứng được đánh giá như thế nào?
Nhiều tổ chức y tế dùng hệ thống GRADE để đánh giá mức độ chắc chắn của bằng chứng. GRADE xếp chất lượng bằng chứng thành bốn mức: cao, trung bình, thấp và rất thấp. Mức độ này có thể bị hạ xuống vì các yếu tố như nguy cơ sai lệch, kết quả không nhất quán giữa các nghiên cứu hay số liệu không chính xác (Guyatt et al., 2008).
Điểm quan trọng của GRADE là nó tách hai câu hỏi: bằng chứng chắc chắn đến đâu, và khuyến cáo nên mạnh đến đâu. Một khuyến cáo có thể được đưa ra dù bằng chứng chưa thật chắc chắn, nhưng khi đó nó cần được diễn đạt thận trọng hơn.
Tổng quan hệ thống có luôn đáng tin không?
Không phải lúc nào cũng vậy. Năm 2016, nhà dịch tễ học John Ioannidis phân tích dữ liệu PubMed và ghi nhận số tổng quan hệ thống công bố mỗi năm tăng 2.728% trong giai đoạn 1991-2014, trong khi tổng số bài báo được lập chỉ mục chỉ tăng 153%. Ông cho rằng phần lớn các tổng quan và phân tích gộp được sản xuất ra có thể không cần thiết, gây hiểu nhầm hoặc có xung đột lợi ích (Ioannidis, 2016).
Vì vậy, gặp cụm từ “theo một phân tích gộp” chưa đủ để kết luận vấn đề đã được giải quyết. Bạn vẫn nên xem tổng quan đó do ai thực hiện, gộp những nghiên cứu nào, và chính các tác giả đánh giá mức độ chắc chắn của bằng chứng ra sao.
Khi nào có thể nói khoa học đã có câu trả lời khá chắc chắn?
Mức độ tin cậy tăng lên khi có nhiều dấu hiệu cùng lúc: nhiều nghiên cứu độc lập, với thiết kế mạnh, cho kết quả nhất quán; các tổng quan hệ thống chất lượng cao đánh giá bằng chứng ở mức chắc chắn cao; và các cơ quan chuyên môn đưa ra khuyến cáo dựa trên đó. Khi những yếu tố này thiếu, cách diễn đạt phù hợp hơn là “bằng chứng hiện có gợi ý”, thay vì “khoa học đã chứng minh”.
Câu hỏi thường gặp
Nếu nghiên cứu mới mâu thuẫn với khuyến cáo hiện hành thì nên làm gì?
Thường nên tiếp tục theo khuyến cáo hiện hành cho đến khi cơ quan chuyên môn xem xét lại. Một nghiên cứu mới là lý do để theo dõi, chưa phải lý do để thay đổi ngay hành vi sức khỏe.
Tổng quan hệ thống khác bài tổng quan thông thường thế nào?
Tổng quan hệ thống có quy trình tìm kiếm và đánh giá được mô tả rõ ràng, có thể lặp lại. Bài tổng quan thông thường do tác giả tự chọn tài liệu, nên dễ bị ảnh hưởng bởi quan điểm cá nhân hơn.
Bằng chứng ở mức “thấp” có nghĩa là thông tin đó sai?
Không. Mức thấp nghĩa là chúng ta chưa chắc chắn, và kết quả có thể thay đổi đáng kể khi có thêm nghiên cứu. Đó là thông tin về mức độ tin cậy, không phải phán quyết đúng hay sai.
Kết luận
Một nghiên cứu mới có thể mở ra hướng đi đáng chú ý, nhưng hiếm khi tự nó đủ để kết luận điều gì là đúng. Khi đọc tin “một nghiên cứu mới cho thấy…”, bạn có thể tự hỏi: đã có nghiên cứu nào lặp lại chưa, các tổng quan hệ thống nói gì, và cơ quan chuyên môn đánh giá bằng chứng chắc chắn đến đâu. Các nguyên tắc chung để đánh giá thông tin khoa học được tổng hợp trong bài Làm sao biết thông tin khoa học trên mạng có đáng tin?.
Đôi lời giới thiệu
Bài viết này được tổng hợp bởi Nguyễn Hoàng Anh Khoa (Dy Khoa), giảng viên Khoa Quan hệ công chúng và Truyền thông, Trường Đại học Văn Lang, và là người tốt nghiệp Thạc sĩ Truyền thông Khoa học và Thu hút Công chúng (Science Communication and Public Engagement) tại Universiti Malaya (UM), Malaysia. Đây là lĩnh vực chuyên môn cốt lõi mà anh được đào tạo bài bản và tiếp tục theo đuổi trong nghiên cứu, giảng dạy và thực hành nghề nghiệp.
Nếu bạn thấy bài viết có sai sót hoặc muốn góp ý, vui lòng gửi email về [email protected].
Tài liệu tham khảo
- Cullinan, K. (2025, January 9). Publisher retracts controversial COVID-19 treatment study. Health Policy Watch. https://healthpolicy-watch.news/publisher-retracts-controversial-covid-19-treatment-study/
- Guyatt, G. H., Oxman, A. D., Vist, G. E., Kunz, R., Falck-Ytter, Y., Alonso-Coello, P., & Schünemann, H. J. (2008). GRADE: An emerging consensus on rating quality of evidence and strength of recommendations. BMJ, 336(7650), 924-926. https://doi.org/10.1136/bmj.39489.470347.AD
- Ioannidis, J. P. A. (2016). The mass production of redundant, misleading, and conflicted systematic reviews and meta-analyses. The Milbank Quarterly, 94(3), 485-514. https://doi.org/10.1111/1468-0009.12210
- Murad, M. H., Asi, N., Alsawas, M., & Alahdab, F. (2016). New evidence pyramid. Evidence-Based Medicine, 21(4), 125-127. https://doi.org/10.1136/ebmed-2016-110401
- Open Science Collaboration. (2015). Estimating the reproducibility of psychological science. Science, 349(6251), Article aac4716. https://doi.org/10.1126/science.aac4716
- RECOVERY Collaborative Group. (2020). Effect of hydroxychloroquine in hospitalized patients with Covid-19. The New England Journal of Medicine, 383(21), 2030-2040. https://doi.org/10.1056/NEJMoa2022926




