AI hỗ trợ nghiên cứu khoa học và kỹ thuật
Đây là module tự chọn cho khối kỹ thuật và khoa học tự nhiên, đào sâu những tác vụ sinh viên ngành kỹ thuật thường gặp: tra cứu và tổng hợp tài liệu chuyên ngành, viết và gỡ lỗi code, giữ liêm chính khi nghiên cứu. Một điều cần khẳng định ngay: AI là trợ thủ giúp người kỹ sư đi nhanh hơn, chứ không thay tư duy phản biện, không thay việc tự tay kiểm chứng và càng không thay trách nhiệm của người đứng tên công trình.
Công cụ AI tra cứu khoa học
Trên nền các cơ sở dữ liệu học thuật (Scopus, IEEE Xplore, arXiv) đã xuất hiện một thế hệ công cụ AI chuyên cho nghiên cứu. Chúng không chỉ trả về danh sách liên kết mà còn tổng hợp, so sánh và trích dẫn nguồn cụ thể. Bốn công cụ tiêu biểu, mỗi cái có thế mạnh riêng:
| Công cụ | Thế mạnh chính | Hợp với tác vụ | Phí |
|---|---|---|---|
| Perplexity | Tổng hợp nhanh, trả lời kèm trích dẫn nguồn ngay trong câu | Nắm tổng quan, lần theo nguồn gốc một khẳng định | Có bản miễn phí, bản trả phí mở rộng |
| Elicit | Lập bảng so sánh nhiều bài báo theo tiêu chí | Làm tổng quan tài liệu, sàng lọc theo phương pháp | Miễn phí giới hạn lượt, có bản trả phí |
| Consensus | Rút gọn kết luận đồng thuận từ nhiều bài | Trả lời câu hỏi "đa số nghiên cứu nói gì" | Miễn phí giới hạn, có bản trả phí |
| SciSpace | Giải thích đoạn khó, công thức, thuật ngữ khi đọc | Đọc sâu một bài báo toàn văn | Có bản miễn phí, bản trả phí mở rộng |
:::tip Quy tắc an toàn Các công cụ này tăng tốc khâu sàng lọc và đọc hiểu, nhưng không thay được việc đọc kỹ bản gốc của những tài liệu cốt lõi. AI giúp chọn ra mười bài đáng đọc trong số một trăm, còn việc đọc kỹ và trích dẫn mười bài ấy vẫn là của bạn. :::
Một quy trình bốn bước bài bản: tìm (truy vấn rõ chủ đề trên Scopus, IEEE Xplore, arXiv), đọc (sàng lọc và đọc sâu bằng SciSpace, Elicit), tóm tắt (rút ý chính, lập bảng so sánh phương pháp), trích dẫn (ghi nguồn đầy đủ qua Zotero, đúng chuẩn). Mỗi bước đều có một van kiểm chứng của con người: nguồn có thẩm quyền chưa, đã bình duyệt chưa, số liệu có khớp bản gốc không.
:::caution Cẩn trọng với bản thảo chưa bình duyệt Bản thảo (preprint) trên arXiv chưa qua bình duyệt chính thức. Một con số chỉ vì xuất hiện trong tài liệu dạng PDF trông giống bài báo thì chưa chắc đã đúng. Hãy ưu tiên bản đã đăng chính thức và đối chiếu nhiều nguồn. :::
AI hỗ trợ viết và gỡ lỗi code
Nhiều ngành nay cần viết các đoạn code ngắn để xử lý dữ liệu, điều khiển thiết bị hoặc tự động hóa thao tác lặp. Các trợ lý mã như GitHub Copilot, hoặc trợ lý hội thoại như ChatGPT, Gemini, hỗ trợ ba việc: gợi ý hoàn thiện mã đang viết, giải thích một đoạn mã có sẵn, và giúp tìm rồi sửa lỗi.
Cách dùng hiệu quả là xem AI như một bạn lập trình ngồi cạnh, theo một vòng lặp: viết (mô tả ý định, nhận mã đề xuất), chạy thử (tự chạy, quan sát kết quả), đọc lỗi (dán lỗi cho AI, hỏi nguyên nhân), hiểu rồi sửa (tự hiểu cách sửa, không chép mù). Trong vòng lặp đó bạn luôn là người chạy thử và quyết định cuối cùng.
Khi nhờ AI phân tích dữ liệu, cách an toàn hơn là mô tả thật rõ để AI sinh ra mã cho bạn tự chạy, thay vì để AI vừa đọc dữ liệu vừa tự kết luận. So sánh hai yêu cầu dưới đây:
- Mơ hồ: "Phân tích tệp số liệu này giúp tôi." AI phải tự đoán nhiều thứ và có thể trả về kết luận sai ý.
- Rõ ràng: "Tệp
measure.csvcó hai cột nhietdo (độ C) và hieusuat (phần trăm). Viết mã Python dùng pandas: đọc tệp, loại dòng thiếu, vẽ biểu đồ phân tán, tính hệ số tương quan Pearson. Chú thích tiếng Anh." Yêu cầu này nêu rõ tên tệp, tên cột, đơn vị và các bước, nên kết quả vừa kiểm chứng được vừa do bạn tự chạy.
:::danger Không chép mã AI khi chưa hiểu Không bao giờ chép mã do AI sinh vào bài nộp hay hệ thống thật mà chưa hiểu từng dòng và chưa tự chạy thử. Mã AI có thể chạy được nhưng vẫn sai logic, hoặc chứa lỗ hổng an toàn. Nộp mã AI như mã của riêng mình là vi phạm liêm chính học thuật. :::
Liêm chính nghiên cứu: không bịa số liệu
Trong nghiên cứu, vi phạm liêm chính nghiêm trọng nhất là bịa số liệu. Khi bạn yêu cầu chung chung và mô hình thiếu dữ liệu, nó có thể sinh ra những con số nghe hợp lý nhưng không có thật, gọi là "ảo giác" (hallucination). Mọi giá trị trong báo cáo phải truy ngược được về dữ liệu đo thật.
AI hỗ trợ tốt ở nhiều khâu, miễn là bạn giữ vai trò tác giả thực sự: lập dàn ý báo cáo, biên tập ngôn ngữ học thuật, chuyển báo cáo dài thành bộ slide bằng Gamma.app, thiết kế bố cục poster. Ranh giới đúng đắn rất rõ: AI được dùng để cải thiện cách trình bày những gì bạn đã làm và đã hiểu, không phải để tạo ra nội dung bạn chưa từng thực hiện. Bạn vẫn phải hiểu từng câu trong báo cáo và bảo vệ được nó trước hội đồng.
:::tip Nguyên tắc xuyên suốt AI lo phần lặp đi lặp lại và tốn công, con người lo phần phán đoán, kiểm chứng và chịu trách nhiệm. Người kỹ sư giỏi không phải người dùng AI nhiều nhất, mà là người biết khi nào tin AI, khi nào phải tự kiểm tra. :::
Thử ngay: đo mức trùng lặp giữa bài viết và nguồn
Câu hỏi "bài của em trùng bao nhiêu phần trăm" nghe như chuyện cảm tính, nhưng nó tính được, và cách tính đơn giản đến mức hơi bất ngờ. Phần mềm kiểm tra sao chép không đọc hiểu bài bạn viết. Nó cắt cả hai văn bản thành những cụm n từ liền nhau rồi đếm xem cụm nào của bài cũng có mặt trong nguồn.
Một văn bản w từ cho ra đúng w - n + 1 cụm. Lấy tám từ mọi con số trong báo cáo vẫn phải với n = 5, ta được 8 - 5 + 1 = 4 cụm, trượt từng bước một từ: mọi con số trong báo, con số trong báo cáo, số trong báo cáo vẫn, trong báo cáo vẫn phải. Tám từ ấy nằm nguyên trong đoạn nguồn của sim, nên cả bốn cụm đều trùng và tỉ lệ trùng của riêng mẩu đó bằng đúng 1.
Sim dưới đây làm đúng phép đếm ấy. Ô bên trái là bài của người học, ô bên phải là nguồn, cả hai đều sửa được, và mọi con số bên dưới tính lại theo từng chữ bạn gõ.
1 · Chuẩn hoá trước khi đếm ✎ sửa được
Ba núm chạy theo đúng thứ tự này: bỏ dấu câu, rồi thường hoá chữ, rồi bỏ dấu tiếng Việt. Sau đó văn bản được cắt theo khoảng trắng, nên một từ ở đây là một âm tiết, không phải một từ ghép trong từ điển. Bài của người học đang có 46 từ, nguồn có 33 từ.
2 · Chỗ nào trùng
"mọi con số trong báo cáo vẫn phải truy ngược được về dữ liệu đo thật".. Con số này được tính bằng một phép riêng, không phải suy ra từ chuỗi cụm, vì nhiều cụm trùng liên tiếp chưa chắc ghép lại thành một đoạn liền mạch trong nguồn.
3 · Hai kiểu Jaccard, hai con số
| Tính trên | Bài có | Nguồn có | Chung | Hợp | Jaccard |
|---|---|---|---|---|---|
| tập từ (không kể thứ tự) | 43 | 32 | 16 | 59 | 0,271 |
| tập cụm 5 từ (có thứ tự bên trong cụm) | 42 | 29 | 12 | 59 | 0,203 |
Hàng trên chỉ hỏi bài dùng những từ nào, nên đảo thứ tự cả câu nó vẫn không đổi. Hàng dưới hỏi bài dùng những cụm nào, nên nó nhạy với thứ tự. Kéo n về 1 thì hai hàng trùng khít nhau, vì cụm một từ chính là từ.
- Nó đếm chữ, nó không đọc được ý định. Trùng nhiều không chứng minh là sao chép: một câu trích dẫn ghi nguồn đầy đủ vẫn trùng 100%. Trùng ít không chứng minh là trung thực: một bài viết lại toàn bộ bằng từ khác vẫn có thể là chiếm dụng ý tưởng của người khác.
- Vì thế diễn giải lại không phải cách lách. Việc cần làm là ghi nguồn, không phải làm tụt con số. Hai preset viết lại toàn bộ bằng lời khác và tự viết từ đầu cho cùng một tỉ lệ trùng, mà một cái phải ghi nguồn còn một cái thì không: sim không phân biệt được hai ca đó, người đọc bài thì phân biệt được.
- Đây không phải công cụ chống sao chép của trường. Mỗi hệ thống thật có cách cắt từ, cách chuẩn hoá, kho đối chiếu và ngưỡng riêng, nên con số của nó sẽ khác con số ở đây. Đừng đem tỉ lệ trên màn hình này đi tranh luận về một tỉ lệ do Turnitin in ra.
- Hai quy ước của sim, nói rõ để bạn không tưởng đó là chân lý. Thứ nhất, cụm trùng không bị kẹp số lần: bài lặp một cụm ba lần mà nguồn có một lần thì vẫn tính là ba cụm trùng. Thứ hai, chuỗi trùng dài nhất đếm theo cụm và chỉ nói rằng từng cụm ấy có trong nguồn, chứ không nói chúng nằm liền nhau trong nguồn. Con số từ nguyên văn dài nhất mới là điều đó, và nó được tính bằng một phép độc lập.
- Cắt theo khoảng trắng thì trong tiếng Việt mỗi từ ở đây là một âm tiết. Cụm 5 âm tiết chỉ tương đương chừng hai ba từ ghép, nên đừng đem n của sim so trực tiếp với n của một công cụ làm việc trên tiếng Anh.
Ở trạng thái mặc định, sim đang nói gì
Preset đang chọn là trích dẫn có ghi nguồn đầy đủ: người học chép nguyên một câu của nguồn, đặt trong ngoặc kép, nói rõ lấy từ đâu, rồi viết tiếp phần bình luận của mình. Bài có 46 từ, nguồn có 33 từ, và với n = 5:
- bài cắt được 42 cụm, nguồn cắt được 29 cụm;
- 12 cụm của bài có mặt trong nguồn, nên tỉ lệ trùng là
12 / 42, tức 28,6%; - 12 cụm ấy nằm liền nhau, phủ 16 từ của bài, và một phép tính riêng xác nhận đúng 16 từ đó là nguyên văn của nguồn: chính là câu trích dẫn;
- Jaccard trên tập từ là
16 / 59 = 0,271, còn Jaccard trên tập cụm 5 từ là12 / 59 = 0,203.
Nhìn phần tô sáng là thấy ngay chuyện gì đã xảy ra: cả khối trùng nằm gọn trong ngoặc kép, 30 từ còn lại của bài không trùng chữ nào. Đây là hình dạng số của một hành vi hoàn toàn trung thực, mà con số thì gần 30%.
Bốn tình huống thật, bốn hình dạng số
Bấm lần lượt bốn preset đầu. Cùng một đoạn nguồn, bốn cách làm bài mà bạn sẽ thật sự gặp trong năm nhất.
| Bài của người học | Tỉ lệ trùng | Đoạn nguyên văn dài nhất | Jaccard từ | Xét về liêm chính |
|---|---|---|---|---|
| chép nguyên, quên ghi nguồn | 100,0% | 33 từ, tức cả đoạn nguồn | 1,000 | vi phạm |
| trích dẫn có ghi nguồn đầy đủ | 28,6% | 16 từ | 0,271 | trung thực |
| chép rồi đổi vài từ | 72,4% | 22 từ | 0,882 | vi phạm |
| viết lại toàn bộ bằng lời khác | 0,0% | 1 từ | 0,050 | vẫn phải ghi nguồn |
| tự viết từ đầu | 0,0% | 2 từ | 0,053 | trung thực |
Hai hàng cuối là chỗ đáng dừng lại. Chúng cho cùng một tỉ lệ trùng, đúng 0,0%, và Jaccard trên tập cụm của cả hai cũng đúng bằng 0. Một bài lấy trọn ý của nguồn rồi diễn đạt lại bằng chữ khác, một bài kể chuyện chính người viết đã làm. Sim không phân biệt được hai ca đó. Người đọc bài thì phân biệt được, chỉ cần hỏi một câu: ý này ở đâu ra.
Đổi vài từ đồng nghĩa: con số nhúc nhích, đoạn nguyên văn vẫn còn
Preset chép rồi đổi vài từ đổi đúng hai từ trong đoạn 33 từ. Kết quả:
- Jaccard trên tập từ chỉ tụt từ
1,000xuống0,882; - tỉ lệ trùng cụm còn 72,4%, tức 21 trong 29 cụm;
- chuỗi cụm trùng liên tiếp dài nhất là 18 cụm, và đoạn nguyên văn dài nhất vẫn 22 từ, tức hai phần ba đoạn nguồn còn nguyên chữ.
Vậy nên chuyện thay từ đồng nghĩa cho tụt con số không phải một cách lách, nó chỉ là một cách làm con số nhúc nhích. Điều duy nhất biến một đoạn vay mượn thành hợp lệ là ghi nguồn, không phải hạ tỉ lệ.
Hai kiểu Jaccard nói hai chuyện khác nhau
Jaccard lấy số phần tử chung chia cho số phần tử của hợp hai tập. Sim tính nó hai lần trên cùng cặp văn bản: một lần trên tập từ, một lần trên tập cụm n từ. Ở trạng thái mặc định hai con số lệch nhau khá xa, 0,271 và 0,203, vì tập từ không biết gì về thứ tự: đảo lộn cả câu thì nó không đổi. Tập cụm thì nhạy với thứ tự, nên nó luôn khắt khe hơn khi bài đã bị xáo trộn.
Kéo n về 1 rồi nhìn lại bảng: hai hàng trùng khít nhau, cùng 0,271, vì cụm một từ chính là từ. Kéo n lên thì tỉ lệ trùng của cùng cặp văn bản này tụt dần, từ 41,3% ở n = 1 xuống 14,3% ở n = 12, trong khi đoạn nguyên văn dài nhất vẫn đúng 16 từ ở mọi giá trị của n. Rút ra: đừng bao giờ đem một tỉ lệ trùng so với một tỉ lệ trùng khác mà không biết hai bên cắt cụm mấy từ.
Ba núm chuẩn hoá đổi hẳn kết luận
Trước khi đếm, sim chuẩn hoá từng từ theo ba bước bật tắt được: bỏ dấu câu, rồi thường hoá chữ, rồi bỏ dấu tiếng Việt. Ba núm này không phải để trang trí.
- Preset chép nguyên, sai hoa thường là một bài chép nguyên từ ba dòng gạch đầu dòng trên slide, nên có ba chữ hoa giữa câu. Núm thường hoá chữ đang tắt, và tỉ lệ trùng là 48,3%, chuỗi trùng dài nhất chỉ 6 cụm, đoạn nguyên văn chỉ 10 từ. Bật núm đó lên: 100,0%, chuỗi 29 cụm, nguyên văn cả 33 từ. Không một chữ nào trong bài đổi, chỉ cách đếm đổi.
- Preset chép nguyên, gõ không dấu cho 0,0% khi núm bỏ dấu tiếng Việt đang tắt, và 100,0% khi bật. Cùng một bài chép nguyên, con số đi từ đầu này sang đầu kia của thang.
- Quay lại preset trích dẫn rồi tắt núm bỏ dấu câu: tỉ lệ tụt từ 28,6% xuống 23,8%, đúng 2 cụm, vì hai dấu ngoặc kép dính vào từ đầu và từ cuối của câu trích làm hai cụm ở hai đầu không khớp nữa. Đoạn nguyên văn cũng còn 14 từ thay vì 16.
Bài học thực dụng: khi ai đó đưa bạn một tỉ lệ trùng, con số đó phụ thuộc vào cách công cụ chuẩn hoá chữ, mà cách chuẩn hoá thì hầu như không bao giờ được in ra bên cạnh tỉ lệ.
Mốc biên: khi n lớn hơn số từ của bài
Xoá ô bài viết đi, để lại đúng sáu từ mọi con số trong báo cáo, rồi kéo n. Ở n = 6 bài còn đúng một cụm, cụm đó có trong nguồn, nên tỉ lệ trùng bằng đúng 1. Kéo lên n = 7 thì w - n + 1 bằng 0: bài không còn cụm nào. Lúc đó sim không in ra 0% như thể bài đã sạch, nó báo thẳng không xác định, vì chia cho 0 thì không có nghĩa gì cả. Jaccard trên tập từ vẫn tính được, vì phép đó không dùng tới n. Và ô "từ nguyên văn dài nhất" vẫn báo 6 từ: cả sáu từ ấy đúng là chép nguyên từ nguồn, chỉ là không có cụm 7 từ nào để đem so. Hai phép đo đó độc lập với nhau, và đây là chỗ thấy rõ nhất.
Đây là kiểu lỗi hay gặp nhất khi tự viết công cụ đếm: một bài quá ngắn so với cụm đem đi so sẽ ra con số 0 rất đẹp, và người đọc tưởng là kết luận.
Trùng nhiều không phải bằng chứng, trùng ít không phải giấy chứng nhận
Ba điều phải nói thẳng, vì đây là bài về liêm chính nên nói nửa vời còn hại hơn không nói.
Trùng nhiều không chứng minh là sao chép. Một câu trích dẫn ghi nguồn đầy đủ trùng 100% với nguồn, và nó hoàn toàn hợp lệ. Một đoạn liệt kê thuật ngữ chuyên ngành, một công thức, một tên định nghĩa cũng trùng cao mà không ai sai gì.
Trùng ít không chứng minh là trung thực. Hai preset cuối trong bảng trên chấm cùng 0,0%, mà một trong hai vẫn phải ghi nguồn. Chiếm dụng ý tưởng là thứ phép đếm chữ không nhìn thấy.
Sim này không phải công cụ chống sao chép của trường. Mỗi hệ thống thật có cách cắt từ riêng, cách chuẩn hoá riêng, kho đối chiếu riêng và ngưỡng riêng, nên con số của nó sẽ khác con số ở đây. Thêm nữa, cắt theo khoảng trắng thì trong tiếng Việt mỗi "từ" của sim là một âm tiết, nên cụm 5 từ của sim chỉ tương đương chừng hai ba từ ghép.
Công cụ đo trùng lặp đếm chữ, nó không đọc được ý định. Vì thế việc cần làm không phải là kéo con số xuống, mà là ghi nguồn cho mọi thứ không phải của mình: câu chữ thì đặt trong ngoặc kép kèm trích dẫn, ý tưởng thì nêu rõ lấy từ đâu dù bạn đã diễn đạt lại bằng lời mình. Làm đúng như vậy thì tỉ lệ trùng có cao bạn cũng giải thích được từng khối một, và đó mới là thứ bảo vệ bạn.
Phần trên chỉ đào vào một phép đo cụ thể. Toàn bộ phổ từ hỗ trợ hợp lệ tới gian lận, cách khai báo khi được yêu cầu, và cách giữ tư duy phản biện khi máy làm hộ gần hết thì nằm ở bài Liêm chính học thuật và tự chủ trí tuệ thời AI của môn Đạo đức và pháp luật AI.
- 1Muốn lập bảng so sánh nhiều bài báo theo phương pháp, cỡ mẫu và kết quả, công cụ nào hợp nhất?
- 2Muốn đọc sâu và hiểu các đoạn khó, công thức, thuật ngữ ngay trong một bài báo toàn văn, nên dùng?
- 3Vì sao tài liệu trên arXiv cần đọc cẩn trọng hơn bài đã đăng chính thức?
- 4Cách dùng AI an toàn hơn khi phân tích một tệp dữ liệu là gì?
- 5Một bạn dùng AI sinh toàn bộ phần kết quả và bàn luận dù chưa làm thí nghiệm, lý do "số liệu nghe hợp lý". Đây là gì?
- 6Một bài được đo trùng 100% với tài liệu gốc, và toàn bộ đoạn trùng nằm gọn trong ngoặc kép kèm trích dẫn nguồn đầy đủ. Kết luận nào đúng?
- 7Một bài chép nguyên đoạn nguồn 33 từ rồi chỉ đổi hai từ đồng nghĩa. Trong sim, điều gì xảy ra?
- 8Bài của bạn chỉ có 6 từ mà bạn kéo n lên 7. Sim nên báo gì?
- 9Cùng một bài chép nguyên, khi núm bỏ dấu tiếng Việt tắt thì sim báo 0,0%, khi bật thì báo 100,0%. Nên hiểu thế nào?