Đọc một bài báo khoa học và đánh giá bằng chứng
Đọc một bài báo khoa học và đánh giá bằng chứng
Bài đã bình duyệt, số liệu có thật, hình vẽ đàng hoàng, và kết luận vẫn có thể không đứng được. Đây là chỗ bạn phải tự đọc bằng chứng chứ không đọc lời kể về bằng chứng.
Ba bài trước đã dựng xong ba tầng. Ở khai thác thông tin bạn học cách hỏi cho đúng và chấm một nguồn bằng khung CRAAP. Ở đọc biểu đồ và con số bạn học rằng một nguồn sạch vẫn có thể vẽ một bức tranh làm bạn hiểu ngược. Ở AI hỗ trợ nghiên cứu bạn học cách nhờ máy sàng lọc tài liệu mà vẫn giữ được quyền tác giả.
Bài này bắt đầu ở chỗ cả ba tầng đó đã xong: nguồn đáng tin, hình vẽ không gian dối, tài liệu đã tìm được. Bạn đang cầm một bài báo khoa học thật, và bạn phải tự trả lời một câu: bằng chứng trong bài này mạnh tới đâu.
Đó là một câu hỏi khác hẳn. Nó không hỏi ai viết, không hỏi đăng ở đâu, không hỏi hình có đẹp không. Nó hỏi: cái kết luận kia dựa trên bao nhiêu quan sát, có gì khác cũng giải thích được kết quả đó không, và phần nào trong bài là số đo còn phần nào là lời bàn của tác giả.
Đọc một bài báo không phải đọc từ đầu tới cuối
Bài báo khoa học được viết theo một thứ tự và nên được đọc theo một thứ tự khác. Người mới thường mở ra rồi đọc tuần tự, tới phần bàn luận thì mệt và chỉ kịp nhớ mấy câu kết. Kết quả là thứ họ mang về chính là phần ít bằng chứng nhất của bài.
Thứ tự nên dùng nằm ngay trong sim bên dưới, ở mục số 0. Bốn bước, xếp theo mức bằng chứng giảm dần: tóm tắt, rồi hình và bảng, rồi phương pháp, rồi mới tới bàn luận.
Lý do phần bàn luận đứng cuối đáng nói kỹ. Trong phần kết quả, tác giả báo cáo cái máy đo được. Trong phần bàn luận, tác giả diễn giải cái đó có nghĩa gì. Hai việc này khác nhau tới mức chúng thường bị đặt ở hai chương riêng chính vì thế. Một câu như "kết quả cho thấy phương pháp của chúng tôi phù hợp với ứng dụng thực tế" không phải một số đo, nó là một ý kiến của người vừa dành hai năm cho phương pháp đó. Ý kiến ấy có thể đúng, nhưng nó không phải bằng chứng, và bạn không được phép chép nó vào bài của mình như thể nó là bằng chứng.
Thói quen nên tập: đọc hình và bảng trước khi đọc lời tác giả nói về hình và bảng. Nếu bạn tự rút ra được một kết luận rồi mới đọc phần bàn luận, bạn sẽ thấy ngay chỗ nào tác giả đi xa hơn dữ liệu của chính họ. Nếu bạn đọc bàn luận trước, bạn sẽ nhìn hình qua mắt của tác giả và không còn thấy gì khác được nữa.
Gõ cỡ mẫu vào, xem một kết quả nặng bao nhiêu
Bài đọc biểu đồ và con số đã cho bạn thấy một mẫu nhỏ nhạy tới mức nào: trong mẫu bốn người, một phiếu đổi ý làm tiêu đề dịch 25 điểm phần trăm. Bài đó đã nói rõ nó chỉ đo độ nhạy, không đo khoảng dao động, vì khoảng dao động cần thêm giả thiết về cách lấy mẫu.
Sim dưới đây làm đúng phần còn thiếu ấy. Bạn đặt cỡ mẫu và số quan sát thuận cho hai nghiên cứu, đặt mức tin cậy, rồi hệ tính lại khoảng dao động của từng tỉ lệ và trả lời một câu: hai kết quả này có phân biệt được với nhau không.
0 · Thứ tự đọc một bài báo bảng tra, không sửa
Không đọc từ đầu tới cuối. Bốn bước dưới đây xếp theo mức bằng chứng giảm dần, nên bước cuối cùng là chỗ ít bằng chứng nhất.
- 1Tóm tắtBài hỏi gì, trả lời gì, trên bao nhiêu mẫu. Đọc để quyết định có đọc tiếp hay không.
- 2Hình và bảngSố liệu thật nằm ở đây. Cỡ mẫu là bao nhiêu, đơn vị là gì, trục dọc bắt đầu từ đâu.
- 3Phương phápNhững con số kia sinh ra thế nào. Ai được đo, đo bằng cách nào, đem so với cái gì.
- 4Bàn luậnChỗ tác giả DIỄN GIẢI kết quả của mình. Đọc sau cùng, và đọc như một ý kiến chứ không phải bằng chứng.
1 · Cỡ mẫu quyết định một kết quả đáng tin tới đâu ✎ sửa được
Hai nghiên cứu, hai tỉ lệ. Câu hỏi không phải “tỉ lệ nào cao hơn”, mà là hai con số đó có phân biệt được với nhau không. Đổi cỡ mẫu và giữ nguyên hai tỉ lệ để thấy câu trả lời đổi.
2 · Một biến thứ ba giải thích được cả hai bên ✎ sửa được
Hai nhóm sinh viên, cùng một kỳ thi. Nhóm A dùng một ứng dụng luyện tập, nhóm B không. Mỗi nhóm lại chia thành hai tầng: những người vốn đã học khá và những người chưa. Ô hiệu quả thật là số điểm mà ứng dụng thật sự cộng thêm, trong mọi tầng. Để nó ở 0 và nhìn tỉ lệ gộp.
| Tầng | Nhóm A: người | A: đỗ | A: tỉ lệ | Nhóm B: người | B: đỗ | B: tỉ lệ | Chênh trong tầng |
|---|---|---|---|---|---|---|---|
| Vốn đã khá | 180 | 144 | 80,0% | 20 | 16 | 80,0% | ±0,0 điểm |
| Chưa khá | 20 | 8 | 40,0% | 180 | 72 | 40,0% | ±0,0 điểm |
| Gộp cả hai tầng | 200 | 152 | 76,0% | 200 | 88 | 44,0% | +32,0 điểm |
3 · Số trích dẫn tích luỹ theo thời gian ✎ sửa được
Hai bài báo, mỗi bài nhận đều đặn một số trích dẫn mỗi năm. Nhịp đó là thứ đáng so, còn tổng số thì phụ thuộc vào bài đã ra đời bao lâu.
- Mọi con số ở đây là số minh hoạ. Không mục nào mô tả một nghiên cứu, một tạp chí hay một tổ chức có thật. Cái đáng học là phép tính, không phải bản thân con số.
- Khoảng dao động ở mục 1 là dạng xấp xỉ chuẩn, cách tính phổ biến nhất và cũng là cách hỏng rõ nhất ở hai đầu thang. Ở tỉ lệ 0% hoặc 100% nó cho bề rộng bằng 0, điều đó sai, và sim báo thẳng ra chứ không giấu. Có những cách tính khác không mắc lỗi này, và một bài báo nghiêm túc sẽ nói rõ nó dùng cách nào.
- Hai khoảng chồng nhau không chứng minh là hai kết quả bằng nhau. Đó là phép đọc thận trọng: nó nói “chưa phân biệt được”, không nói “không khác nhau”. Chiều ngược lại thì chắc hơn: hai khoảng tách rời là dấu hiệu mạnh của một chênh lệch thật.
- Con số cỡ mẫu nhỏ nhất giả định hai tỉ lệ giữ nguyên khi mẫu lớn lên. Trong đời thật hỏi thêm người thì tỉ lệ cũng đổi, nên hãy đọc nó là “cần cỡ này thì mới đáng bàn” chứ không phải một lời hứa.
- Mục 2 dựng sẵn một ca mà hai tầng có cùng tỉ lệ ở cả hai nhóm, để chứng minh rằng thành phần nhóm một mình nó đủ tạo ra một chênh lệch lớn. Đó là một ca dựng, không phải một quy luật: nó cho thấy tương quan có thể sinh ra từ biến thứ ba, chứ không cho thấy tương quan nào cũng vậy.
- Mục 3 dùng nhịp trích dẫn đều cho dễ tính. Đường trích dẫn thật không thẳng, nên đừng mang con số “bao nhiêu năm thì vượt” ra ngoài sim này.
Ở trạng thái mở bài, sim đang nói gì
Hai nghiên cứu, mỗi nghiên cứu hỏi 10 người. Nghiên cứu A có 7 người trả lời thuận, tức 70,0%. Nghiên cứu B có 5 người, tức 50,0%. Hai tiêu đề đó cách nhau 20,0 điểm phần trăm, nghe như một khoảng cách rất rõ.
Bây giờ tính độ rộng của cái mà mỗi con số kia thật sự cho phép nói.
Một tỉ lệ đo trên n người dao động quanh giá trị thật của nó, và mức dao động đó là căn bậc hai của p nhân 1 - p chia n. Với A thì đó là căn của 0,7 × 0,3 ÷ 10, tức căn của 0,021. Nhân với hệ số 1,960 của mức tin cậy 95% thì nửa bề rộng của khoảng là 28,4 điểm.
Cộng trừ 28,4 điểm quanh 70,0% ra khoảng 41,6% tới 98,4%, tức bề rộng 56,8 điểm. Với B, nửa bề rộng là 31,0 điểm, khoảng là 19,0% tới 81,0%, bề rộng 62,0 điểm.
Hai khoảng đó chồng lên nhau trên 39,4 điểm. Nói cách khác: với dữ liệu này, một tỉ lệ thật là 60% giải thích được cả hai kết quả cùng lúc. Sim ghi kết luận bằng chữ, chưa phân biệt được, chứ không chỉ đổi màu.
Đây là câu đáng mang đi: hai kết quả khác nhau 20 điểm mà vẫn không nói được gì, vì mỗi kết quả chỉ dựa trên mười người.
Bốn lần cỡ mẫu, khoảng hẹp còn một nửa
Kéo cỡ mẫu lên và giữ nguyên tỉ lệ. Với tỉ lệ 70% ở mức tin cậy 95%, nửa bề rộng đi như sau:
| Cỡ mẫu | Nửa bề rộng khoảng |
|---|---|
| 10 | 28,4 điểm |
| 40 | 14,2 điểm |
| 160 | 7,1 điểm |
| 640 | 3,6 điểm |
Mỗi hàng nhân cỡ mẫu lên bốn lần và bề rộng co còn một nửa. Đó không phải trùng hợp: bề rộng tỉ lệ với 1 chia căn của n, nên muốn chia đôi bề rộng thì phải nhân cỡ mẫu lên bốn. Cổng kiểm số của bài này khoá bất biến ấy trên 600 cấu hình với ngưỡng 1e-12, và khe lệch lớn nhất nó đo được nằm xa dưới ngưỡng đó, tức đúng bằng nhiễu của số dấu phẩy động chứ không phải một sai lệch thật.
Hệ quả thực dụng: nhân đôi cỡ mẫu không chia đôi sai số, nó chỉ chia cho căn 2. Đây là lý do nghiên cứu tốn tiền một cách khó chịu. Muốn khoảng hẹp đi mười lần thì phải hỏi gấp một trăm lần số người.
Mốc phân biệt được: cần bao nhiêu người
Sim in ra một con số nữa: cỡ mẫu nhỏ nhất mỗi bên để hai khoảng thôi chồng nhau, nếu hai tỉ lệ giữ nguyên. Với 70% so với 50% ở mức tin cậy 95%, con số đó là 89.
Nó giải ra được chứ không phải dò. Hai khoảng còn chồng nhau chừng nào khoảng cách giữa hai tỉ lệ chưa vượt tổng hai nửa bề rộng, mà cả hai nửa bề rộng đều co theo 1 chia căn n, nên điều kiện gom lại thành một ngưỡng duy nhất trên n. Ngưỡng thật ở đây là 88,186, và cỡ mẫu là số nguyên nên đáp số là 89.
Có một chi tiết nhỏ mà thành thật thì phải nói: không số nguyên nào trên mẫu 89 cho đúng tỉ lệ 70%, vì 89 × 0,7 bằng 62,3. Nên hai nút trong sim đặt hai bên mốc bằng hai cỡ mẫu chia hết cho 10:
| Cỡ mẫu mỗi bên | Khoảng của A | Khoảng của B | Kết luận |
|---|---|---|---|
| 80 | 60,0% tới 80,0% | 39,0% tới 61,0% | chưa phân biệt được, còn chung 1,0 điểm |
| 90 | 60,5% tới 79,5% | 39,7% tới 60,3% | phân biệt được, trống 0,2 điểm |
Thêm mười người mỗi bên là đủ để đảo kết luận, trong khi hai tỉ lệ 70% và 50% không đổi một chữ.
Kéo hẳn lên 1.000 người mỗi bên thì mọi thứ rõ hẳn: A còn 67,2% tới 72,8%, rộng 5,7 điểm; B còn 46,9% tới 53,1%, rộng 6,2 điểm; giữa hai khoảng có 14,1 điểm khoảng trống. Cùng hai tỉ lệ ấy, cùng phép tính ấy, chỉ khác cỡ mẫu, mà kết luận đi từ "chưa nói được gì" sang "chênh lệch này không phải may rủi".
Vì thế khi đọc một bài báo, câu hỏi đầu tiên với mọi tỉ lệ là: tỉ lệ này của bao nhiêu người. Một bài không ghi cỡ mẫu bên cạnh con số là một bài đang bắt bạn tin thay vì cho bạn kiểm.
Chỗ công thức này hỏng, và bài không giấu
Bấm nút ca biên: 10 trên 10 trong sim. Tỉ lệ là 100,0%, và bề rộng khoảng in ra là 0,0 điểm.
Con số đó sai. Hỏi mười người và cả mười trả lời thuận thì bạn không hề chứng minh được tỉ lệ thật là 100%: người thứ mười một rất có thể trả lời khác. Cái đang xảy ra là phép xấp xỉ chuẩn mà sim dùng có một lỗ hổng đã biết ở hai đầu thang. Khi p bằng 0 hoặc bằng 1 thì p nhân 1 - p bằng 0, nên mức dao động tính ra bằng 0, nên khoảng thu về một điểm.
Sim không giấu chuyện này. Nó bật một cảnh báo bằng chữ, nói thẳng rằng bề rộng 0 là sai về mặt thống kê, và nói rằng con số cỡ mẫu nhỏ nhất cũng không dùng được khi một bên rơi vào ca này. Có những cách tính khoảng khác không mắc lỗi đó, và một bài báo nghiêm túc sẽ ghi rõ nó dùng cách nào.
Còn một dấu hiệu nữa của cùng một vấn đề. Với 9 trên 10 người, khoảng thô chạy từ 71,4% tới 108,6%: đầu trên vượt quá 100%, tức ra ngoài thang mà tỉ lệ có thể nhận. Sim cắt về 100% để vẽ được, và ghi rõ nó đã cắt. Bề rộng thô là 37,2 điểm còn bề rộng sau khi cắt là 28,6 điểm. Khi bạn thấy một khoảng bị cắt như vậy trong bài báo thật, đó là tín hiệu rằng công thức đang bị dùng ngoài vùng nó chạy tốt.
Một chỗ nữa cần thành thật, và nó đi theo chiều ngược lại. Hai khoảng chồng nhau không chứng minh hai kết quả bằng nhau. Đây là phép đọc thận trọng: nó nói "chưa phân biệt được", không nói "không khác nhau". Chiều kia thì chắc hơn: hai khoảng tách rời là dấu hiệu mạnh của một chênh lệch thật.
Một biến thứ ba giải thích được cả hai bên
Giả sử bạn đã qua được cửa cỡ mẫu. Khoảng dao động hẹp, hai kết quả tách rời, chênh lệch không phải may rủi. Đã kết luận được chưa?
Chưa. Mục 2 của sim dựng đúng ca đó bằng số.
Hai nhóm sinh viên, mỗi nhóm 200 người, cùng một kỳ thi. Nhóm A dùng một ứng dụng luyện tập, nhóm B không. Mỗi nhóm lại chia làm hai tầng: người vốn đã học khá và người chưa. Tỉ lệ đỗ của tầng khá là 80,0%, của tầng chưa khá là 40,0%, và hai tỉ lệ đó giống hệt nhau ở cả hai nhóm. Ô hiệu quả thật đang để ở 0: ứng dụng không cộng thêm một điểm nào cho ai cả.
Nhưng hai nhóm có thành phần khác nhau. Nhóm A có 180 người tầng khá và 20 người tầng chưa khá. Nhóm B thì ngược lại.
Đếm đầu người:
| Tầng | Nhóm A | Nhóm B |
|---|---|---|
| Tầng khá | 180 người, 144 đỗ | 20 người, 16 đỗ |
| Tầng chưa khá | 20 người, 8 đỗ | 180 người, 72 đỗ |
| Gộp lại | 152 trên 200, tức 76,0% | 88 trên 200, tức 44,0% |
Chênh lệch gộp là 32,0 điểm phần trăm. Nếu bạn chỉ nhìn hai con số 76% và 44%, bạn sẽ kết luận ứng dụng có tác dụng rất mạnh. Và bạn sẽ sai hoàn toàn, vì trong mọi tầng hai nhóm đỗ y hệt nhau: chênh lệch trong tầng khá là 0,0 điểm, trong tầng chưa khá cũng 0,0 điểm.
Toàn bộ 32 điểm kia đến từ một chỗ duy nhất: ai đã vào nhóm nào. Sim tách nó ra thành hai phần cộng lại:
Chênh lệch gộp bằng chênh lệch thành phần nhân chênh lệch giữa hai tầng, cộng hiệu quả thật. Ở đây là
(0,9 - 0,1) × (80 - 40) + 0, tức32,0 + 0,0bằng 32,0 điểm.
Cách kiểm cũng gọn: cho hai nhóm cùng một thành phần, tức mỗi nhóm nửa tầng khá nửa tầng chưa khá, rồi tính lại. Cả hai đều ra 60,0%, chênh nhau 0,0 điểm. Biến thứ ba biến mất thì tương quan cũng biến mất theo.
Và khoảng dao động không cứu được bạn ở đây
Đây là chỗ hai nửa của bài nối vào nhau. Mỗi nhóm có 200 người, nên khoảng dao động khá hẹp: nhóm A là 70,1% tới 81,9%, nhóm B là 37,1% tới 50,9%. Hai khoảng tách rời, cách nhau 19,2 điểm.
Tức là: chênh lệch có thật, nó không phải may rủi của phép lấy mẫu, và nó vẫn không do ứng dụng gây ra. Cỡ mẫu trả lời câu "con số này có vững không". Nó không trả lời và không bao giờ trả lời câu "cái gì gây ra con số này".
Muốn thấy hai phần tách nhau, kéo ô hiệu quả thật lên 10 điểm. Nhóm A lên 86,0%, chênh lệch gộp thành 42,0 điểm, và sim tách nó thành 32,0 điểm do thành phần cộng 10,0 điểm do hiệu quả thật. Sau khi cho hai nhóm cùng thành phần thì còn đúng 10,0 điểm, tức 70,0% so với 60,0%. Chỉ phần thứ hai đó mới là thứ ứng dụng làm được.
Ứng dụng thực tế khi đọc bài báo: gặp một tương quan, hãy hỏi ai đã vào nhóm nào, và vì sao. Nếu người tham gia tự chọn nhóm cho mình thì gần như luôn có một biến thứ ba, vì lý do khiến họ chọn cũng là lý do ảnh hưởng tới kết quả. Cách chữa mà các bài báo tốt dùng là chia nhóm ngẫu nhiên, hoặc ít nhất là báo cáo kết quả theo từng tầng chứ không chỉ báo con số gộp. Bảng theo tầng là thứ đầu tiên nên tìm.
Bình duyệt bảo đảm điều gì, và không bảo đảm điều gì
Bình duyệt là quy trình mà bản thảo được gửi cho vài nhà nghiên cứu khác cùng lĩnh vực đọc và cho ý kiến trước khi tạp chí quyết định đăng. Người phản biện thường không biết tác giả là ai, và tác giả thường không biết người phản biện là ai.
Nó bảo đảm những thứ này, ở mức tốt:
- Bài có nêu phương pháp đủ rõ để người khác hiểu đã làm gì.
- Kết luận không đi quá xa so với dữ liệu được trình bày, hoặc nếu đi quá thì bị bắt viết lại.
- Công trình có đặt được vào bối cảnh những gì người khác đã làm.
- Những lỗi rõ trong tính toán, trong cách trình bày, trong cách trích dẫn thường bị nhặt ra.
Nó không bảo đảm những thứ này, và đây mới là phần ít người biết:
- Người phản biện gần như không bao giờ chạy lại thí nghiệm. Họ đọc bài, không làm lại nghiên cứu. Nếu số liệu bị bịa thì rất khó lộ ở khâu này.
- Kết quả đúng. Bình duyệt lọc được bài kém, nó không xác nhận bài còn lại là đúng. Rất nhiều bài đã bình duyệt về sau bị bác bởi nghiên cứu khác, và đó là chuyện bình thường của khoa học chứ không phải bê bối.
- Kết quả lặp lại được. Một nghiên cứu chạy lại đúng cách vẫn có thể ra kết quả khác, và chuyện đó nhiều hơn người ta tưởng.
- Chất lượng đồng đều giữa các tạp chí. Có tạp chí phản biện rất kỹ, có tạp chí chỉ làm cho có, và có cả tạp chí thu tiền rồi đăng gần như mọi thứ.
Tiền ấn phẩm là bản thảo tác giả tự đăng công khai trước khi qua bình duyệt, thường trên arXiv hoặc một kho tương tự. Nó khác bài đã bình duyệt ở một điểm duy nhất mà cũng là điểm quan trọng: chưa ai ngoài nhóm tác giả đọc kỹ nó. Đổi lại, nó ra sớm hơn nhiều tháng, đôi khi cả năm.
Tiền ấn phẩm không phải thứ đáng khinh, nhiều công trình lớn xuất hiện ở đó trước. Nhưng khi trích dẫn thì phải ghi rõ đó là tiền ấn phẩm, và khi nó là chỗ dựa duy nhất cho một khẳng định quan trọng thì phải cẩn thận. Nếu bản chính thức đã ra rồi thì trích bản chính thức, vì nội dung hai bản có thể khác nhau đáng kể sau khi phản biện.
Một câu gọn để mang đi: bình duyệt là một cái sàng, không phải một con dấu. Nó lọc bớt thứ không lọt qua được, nó không đóng dấu bảo đảm cho thứ đã lọt.
Số trích dẫn đo mức được nhắc tới, không đo chất lượng
Người mới đọc tài liệu hay dùng số trích dẫn làm thước nhanh: bài nào nhiều trích dẫn hơn thì tốt hơn. Thước đó hỏng theo hai cách, và mục 3 của sim cho thấy cách thứ hai bằng số.
Cách hỏng thứ nhất là về nghĩa. Trích dẫn đếm số lần một bài được nhắc tới, không đếm nó được nhắc tới theo chiều nào. Một bài bị nhắc tới vì nó sai nổi tiếng vẫn cộng điểm y như một bài được nhắc vì nó nền tảng. Một bài đề xuất bộ dữ liệu mà cả ngành dùng sẽ có rất nhiều trích dẫn mà không đưa ra ý tưởng mới nào. Và những ngành đông người thì mọi bài đều nhiều trích dẫn hơn những ngành ít người, không liên quan gì tới chất lượng.
Cách hỏng thứ hai là về thời gian, và nó đo được. Trích dẫn tích luỹ: một bài chỉ có thể được nhắc tới sau khi nó ra đời, nên bài mới luôn thiệt.
Sim dựng hai bài với nhịp trích dẫn đều, một mô hình đơn giản hoá cho dễ tính. Bài cũ nhận 8 trích dẫn mỗi năm và đã ra đời 10 năm, nên nó có 80. Bài mới nhận 20 trích dẫn mỗi năm và mới ra đời 2 năm, nên nó có 40.
Nhìn tổng số thì bài cũ hơn gấp đôi. Nhìn nhịp thì bài mới được nhắc tới nhiều hơn 2,5 lần mỗi năm. Hai câu đó nói về cùng hai bài báo, và chúng ngược nhau.
Bao lâu thì bài mới vượt? Sim giải ra: ngưỡng là 5,333 năm, nên mốc là năm thứ 6. Ở năm thứ 6 bài mới có 120 còn bài cũ có 112. Ở năm thứ 5 thì bài mới mới có 100 trong khi bài cũ đã có 104, tức vẫn chưa vượt. Suốt năm năm liền, một bài được nhắc tới nhiều hơn hẳn mỗi năm vẫn đứng dưới trong mọi bảng xếp theo tổng số.
Còn một con số nữa đáng nhìn: nếu bài mới cũng đã ra đời 10 năm với đúng nhịp ấy thì nó có 200 trích dẫn, tức gấp hai lần rưỡi bài cũ. Khoảng cách hiện tại giữa 80 và 40 hoàn toàn là tuổi, không có một chút nào là chất lượng.
Nên khi so hai bài, hãy so thứ chia theo thời gian: trích dẫn mỗi năm, hoặc trích dẫn trong ba năm đầu của mỗi bài. Và với một bài vừa ra năm nay thì đừng dùng số trích dẫn làm thước gì cả, nó chưa kịp có.
Cần nói rõ về mô hình trong sim: nhịp đều là một giả thiết cho dễ tính, không phải cách trích dẫn thật vận hành. Bài thật thường rất ít trong một hai năm đầu rồi mới tăng dần. Vì thế con số "bao nhiêu năm thì vượt" chỉ đúng bên trong sim này, và điều đáng mang đi là hình dạng của vấn đề chứ không phải con số. Mọi số ở đây là số minh hoạ: không có tạp chí, tổ chức hay bài báo có thật nào đứng sau chúng.
Nhờ AI tóm tắt một bài báo: rủi ro nằm ở đâu
Bài AI hỗ trợ nghiên cứu đã dựng đầy đủ bộ công cụ và ranh giới liêm chính. Ở đây chỉ thêm một điểm cụ thể, vì nó dính thẳng vào mọi thứ vừa nói ở trên.
Khi bạn nhờ một mô hình tóm tắt một bài báo, cái nó trả về gần như luôn là một bản rút gọn của phần tóm tắt và bàn luận, tức đúng hai chỗ mà thứ tự đọc ở đầu bài xếp là ít bằng chứng nhất. Cỡ mẫu thường rớt mất. Điều kiện thí nghiệm rớt mất. Câu "trong điều kiện phòng thí nghiệm, với vài chục người tham gia" trở thành "nghiên cứu cho thấy". Bản tóm tắt nghe mạch lạc hơn bài gốc, và mạch lạc hơn ở đây có nghĩa là đã mất phần dè dặt, mà phần dè dặt chính là chỗ tác giả nói giới hạn của họ.
Cách dùng an toàn hơn thì đơn giản: dùng AI để định vị, đừng dùng để kết luận. Nhờ nó chỉ ra cỡ mẫu nằm ở đoạn nào, bảng kết quả chính là bảng số mấy, phần hạn chế nằm ở đâu. Rồi tự mở đúng chỗ đó ra đọc. Mọi con số bạn định đưa vào bài của mình thì phải tự nhìn thấy nó trong bản gốc, không phải trong bản tóm tắt.
Toàn bộ phổ từ hỗ trợ hợp lệ tới gian lận, và cách khai báo khi được yêu cầu, nằm ở bài liêm chính học thuật và tự chủ trí tuệ thời AI.
Sim chạy đúng phép tính của ba mục trên, và mọi con số trong bài đều lấy từ chính phép chạy đó. Nhưng có mấy chỗ phải nói rõ.
Mọi số ở đây là số minh hoạ. Không mục nào mô tả một nghiên cứu, một tạp chí hay một tổ chức có thật.
Khoảng dao động ở mục 1 là dạng xấp xỉ chuẩn. Nó hỏng ở hai đầu thang theo đúng cách bài đã mô tả, và một bài báo nghiêm túc sẽ ghi rõ nó tính khoảng bằng cách nào.
Con số cỡ mẫu nhỏ nhất giả định hai tỉ lệ giữ nguyên khi mẫu lớn lên. Đời thật thì hỏi thêm người, tỉ lệ cũng đổi theo. Hãy đọc con số đó là "cần cỡ này thì mới đáng bàn", không phải một lời hứa.
Mục 2 là một ca dựng sẵn: hai tầng được cho cùng tỉ lệ ở cả hai nhóm để chứng minh rằng thành phần nhóm một mình nó đủ tạo ra chênh lệch lớn. Nó cho thấy tương quan có thể sinh ra từ biến thứ ba, chứ không cho thấy tương quan nào cũng vậy. Ngược lại, nó cũng không nói rằng cứ có biến thứ ba là hiệu quả thật bằng 0: kéo ô hiệu quả thật lên và hai phần tách nhau ra ngay.
Cuối cùng, ba mục trên không phải danh sách đầy đủ những cách một bài báo có thể yếu. Còn chuyện chọn thước đo sau khi đã nhìn kết quả, còn chuyện chỉ công bố thí nghiệm thành công, còn xung đột lợi ích của bên tài trợ. Cái nên mang đi không phải ba mục, mà là thói quen đòi xem bằng chứng trước khi đọc kết luận.
Ba câu hỏi nên thành phản xạ với mọi bài báo, và cả ba đều trả lời được trước khi bạn hiểu hết nội dung chuyên môn.
Con số này của bao nhiêu quan sát? Với mười người thì 70% và 50% cho hai khoảng chồng nhau tới 39,4 điểm, tức không phân biệt được. Với một nghìn người thì hai khoảng cách nhau 14,1 điểm và kết luận đứng vững. Cùng hai tỉ lệ ấy, khác nhau ở chỗ có bao nhiêu người đứng sau chúng.
Còn gì khác cũng giải thích được kết quả này? Hai nhóm chênh nhau 32,0 điểm với khoảng dao động tách rời hẳn, mà nguyên nhân là ai đã vào nhóm nào chứ không phải can thiệp. Hãy tìm bảng chia theo tầng, và hỏi người tham gia được chia nhóm bằng cách nào.
Câu này là số đo hay là lời bàn? Phần kết quả báo cáo, phần bàn luận diễn giải. Đọc hình và bảng trước khi đọc lời tác giả nói về hình và bảng, để bạn còn thấy được chỗ nào tác giả đi xa hơn dữ liệu của chính họ.
Và một thói quen cuối, rẻ nhất trong tất cả: đừng dùng số trích dẫn để chấm một bài. Nó đo mức được nhắc tới, nó tích luỹ theo tuổi, và một bài nhận 20 trích dẫn mỗi năm vẫn đứng dưới một bài nhận 8 mỗi năm suốt 5 năm liền chỉ vì bài kia ra đời trước.
- 1Hai nghiên cứu, mỗi nghiên cứu hỏi 10 người. Nghiên cứu A được 7 người đồng ý, tức 70%. Nghiên cứu B được 5 người, tức 50%. Kết luận nào đúng?
- 2Nhóm dùng ứng dụng đỗ 76,0%, nhóm không dùng đỗ 44,0%, mỗi nhóm 200 người, và hai khoảng dao động tách rời nhau 19,2 điểm. Có kết luận được ứng dụng làm tăng tỉ lệ đỗ không?
- 3Bài cũ có 80 trích dẫn sau 10 năm, bài mới có 40 sau 2 năm. Nên đọc hai con số này thế nào?