Chuyển tới nội dung chính

An toàn và liêm chính trong môi trường số

Mỗi ngày bạn để lại vô số dấu vết trên mạng: một lần đăng nhập, một bức ảnh chia sẻ, một bài nhờ trợ lý ảo viết hộ. Những hành vi tưởng nhỏ ấy liên quan trực tiếp tới an toàn tài khoản, danh tiếng cá nhân và cả tính trung thực trong học tập. Bài này bàn về thái độ và thói quen: tự bảo vệ mình, sống có trách nhiệm, và giữ trung thực khi việc sao chép hay nhờ máy làm hộ chưa bao giờ dễ đến thế.

Mật khẩu mạnh và xác thực hai lớp

Mật khẩu vẫn là tuyến phòng thủ đầu tiên. Một mật khẩu mạnh cần đủ dài (tối thiểu mười hai ký tự), trộn chữ hoa, chữ thường, chữ số và ký hiệu, và không chứa thông tin dễ đoán như tên hay ngày sinh. Mỗi tài khoản quan trọng cần một mật khẩu riêng: nếu dùng chung một mật khẩu cho email, ngân hàng và mạng xã hội, chỉ một nơi bị lộ là toàn bộ sụp đổ theo. Dùng trình quản lý mật khẩu (như Bitwarden hoặc Google Password Manager) để máy nhớ giúp.

Xác thực hai lớp (2FA) yêu cầu thêm một yếu tố thứ hai ngoài mật khẩu khi đăng nhập, thường là mã dùng một lần. Ngay cả khi kẻ xấu biết mật khẩu, chúng vẫn không vào được nếu không có yếu tố thứ hai.

Thử ngay: đo sức mạnh mật khẩu bằng bit

Câu "mật khẩu phải dài và phức tạp" nghe thì đúng, nhưng dài bao nhiêu và phức tạp tới đâu thì hầu như không ai nói. Chuyện này đo được. Nếu mật khẩu gồm L ký tự, mỗi ký tự lấy từ một bảng chữ N ký tự, thì số mật khẩu có thể có là N nhân với chính nó L lần. Con số đó to đến mức khó cầm nắm, nên người ta lấy logarit cơ số 2 của nó và gọi kết quả là entropy, đo bằng bit. Phép lấy logarit biến phép nhân thành phép cộng: mỗi ký tự thêm vào cộng đúng log2(N) bit, không hơn không kém.

Hãy bật tắt bốn bộ ký tự và kéo thanh độ dài, rồi đổi cả tốc độ đoán để xem cùng một mật khẩu trụ được bao lâu trước ba kiểu tấn công khác nhau.

Độ dài hay độ phức tạp · đo bằng bit
Bảng chữ 62Entropy 71,45 bitXếp bậc kháDò trung bình 511 thế kỷ
Bộ ký tự:
N = 26 + 26 + 10 = 62. Bật cả bốn là 95 ký tự in được của bảng mã ASCII, tức đúng cái mà quy định "phải có đủ bốn loại" đang nói tới.
Ba con số bạn đặt✎ sửa được
độ dài (số ký tự)
mỗi ký tự thêm vào cộng đúng 5,9542 bit
số từ trong cụm từ
mỗi từ lấy từ danh sách 2.048 từ cộng đúng 11 bit
tốc độ đoán (lần mỗi giây)
Kẻ tấn công đã lấy được tệp mật khẩu và dò ngay trên máy mình, không ai chặn được. Một tỉ lần đoán mỗi giây.
không gian tìm kiếm62^12 ≈ 3,2 × 10^21
entropy theo bit12 × log2(62) = 12 × 5,9542 = 71,4504 bit
thời gian dò trung bình2^(71,4504 - 1) / 1.000.000.000 = 511 thế kỷ
71,45 bit
entropy mật khẩu
khá
≈ 3,2 × 10^21
số mật khẩu có thể có
22 chữ số
511 thế kỷ
dò trung bình
1.000.000.000 lần mỗi giây
44,00 bit
cụm 4 từ ngẫu nhiên
2,4 giờ
Thêm 1 ký tự, hay bật thêm bộ ký hiệu? Bấm thử cả hai.
+ 5,9542 bit
không gian nhân lên 62 lần
so với
+ 7,3879 bit
không gian nhân lên 2^7,39 lần
Ở độ dài 12 này, bật nốt các bộ còn lại được nhiều bit hơn (7,3879 so với 5,9542). Nhưng đó là món quà dùng một lần: bật xong thì hết. Kéo độ dài xuống dưới 10 rồi xem kết quả đảo chiều.
Không gian này đã vượt số nguyên mà JavaScript còn đếm chính xác được, 9.007.199.254.740.991, nên bảng ghi nó dưới dạng luỹ thừa của 10 thay vì viết đủ 22 chữ số. Số bit bên cạnh vẫn chính xác, vì nó là phép cộng chứ không phải phép nhân.
Cách đặtEntropyXếp bậcDò trung bìnhđộ lớn
8 ký tự, chỉ chữ thường37,60 bitrất yếu1,7 phút
8 ký tự, đủ bốn loại52,56 bityếu38 ngày
12 ký tự, chữ hoa thường và số71,45 bitkhá511 thế kỷ
12 ký tự, đủ bốn loại78,84 bitkhá85.615 thế kỷ
16 ký tự, đủ bốn loại105,12 bitrất mạnh≈ 7,0 × 10^12 thế kỷ
cụm 3 từ ngẫu nhiên33,00 bitrất yếu4,3 giây
cụm 4 từ ngẫu nhiên44,00 bityếu2,4 giờ
cụm 6 từ ngẫu nhiên66,00 bitkhá12 thế kỷ
mật khẩu bạn đang đặt71,45 bitkhá511 thế kỷ
cụm từ bạn đang đặt44,00 bityếu2,4 giờ
Những mẹo quen thuộc thêm được bao nhiêu bit
thay a bằng @, o bằng 0, i bằng 1nhiều nhất 3,00 bitmột từ có ba chữ thay được cho ra nhiều nhất 2 mũ 3 bằng 8 biến thể, tức 3 bit
thêm bốn chữ số năm sinh ở cuốinhiều nhất 13,29 bit10.000 khả năng nếu bốn chữ số hoàn toàn ngẫu nhiên, mà năm sinh thì không
thêm một dấu chấm than ở cuốinhiều nhất 5,04 bit33 ký hiệu nếu chọn ngẫu nhiên đều, mà hầu hết mọi người chọn đúng dấu chấm than
viết hoa chữ cái đầunhiều nhất 1,00 bitcó hoa hoặc không, đúng hai khả năng, và ai cũng chọn chữ đầu
Gộp cả bốn mẹo lại, trần lý thuyết là 22,33 bit. Thêm bốn ký tự ngẫu nhiên vào bảng chữ hiện tại được 23,82 bit, tức nhiều hơn cái trần đó. Và trần thì không ai với tới: phần mềm dò mật khẩu có sẵn đúng bốn mẹo này trong bộ luật biến đổi của nó, nên trong thực tế chúng thêm gần như bằng không. Sim này không đo được "gần như bằng không" là bao nhiêu, và cũng không giả vờ đo.

Ở trạng thái mặc định sim đang mô tả một mật khẩu 12 ký tự trộn chữ hoa, chữ thường và chữ số, tức bảng chữ 26 + 26 + 10 = 62. Entropy là 12 × log2(62) = 71,45 bit, không gian tìm kiếm khoảng 3,2 × 10^21 mật khẩu, và một máy để bàn dò một tỉ lần mỗi giây cần trung bình 511 thế kỷ. Bây giờ hãy tắt chữ hoa với chữ số và kéo độ dài về 8: bảng chữ còn 26, entropy tụt xuống 37,60 bit, không gian còn đúng 208.827.064.576 mật khẩu và cũng chính cái máy đó dò xong trong 1,7 phút. Đổi sang dàn card đồ hoạ thì còn 0,1 giây.

Hãy để ý ba tốc độ đoán khác nhau tới cỡ nào. Vẫn mật khẩu 8 chữ thường ấy, một dịch vụ trực tuyến có chặn số lần thử phải mất 3,3 thế kỷ, trong khi dàn card đồ hoạ mất 0,1 giây. Chênh nhau một trăm tỉ lần, và khác biệt duy nhất là kẻ tấn công có lấy được tệp mật khẩu về máy mình hay không. Đây là lý do một vụ lộ dữ liệu ở nơi khác lại nguy hiểm cho tài khoản của bạn ở nơi này, nếu bạn dùng chung mật khẩu.

Thêm một ký tự, hay bật thêm bộ ký hiệu

Khung đấu ở giữa sim so hai cách nâng cấp, và câu trả lời không cố định. Ở mặc định 12 ký tự với bảng chữ 62, thêm một ký tự được log2(62) = 5,9542 bit, còn bật nốt bộ ký hiệu để lên 95 ký tự được 7,3879 bit. Bật bộ ký hiệu thắng. Nhưng kéo độ dài xuống 9 rồi nhìn lại: bật thêm bộ chỉ còn 5,5409 bit và thua một ký tự. Điểm đảo chiều đúng ở độ dài 10, và con số đó do sim tính ra từ hai công thức, không phải một lời phỏng đoán.

Vì sao lại thế? Mở rộng bảng chữ có lợi cho mọi ký tự cùng lúc, nên mật khẩu càng dài thì càng lời. Nhưng đó là món quà dùng đúng một lần: bật hết bốn bộ rồi thì không còn bộ nào để bật nữa, trong khi mỗi ký tự thêm vào vẫn tiếp tục cộng 6,5699 bit mãi mãi. Hãy bấm "bật nốt các bộ còn lại" rồi thử bấm lại: nút tắt luôn, vì không còn gì để thêm. Đó mới là điều đáng nhớ, chứ không phải chuyện bên nào thắng ở một độ dài cụ thể.

Cụm bốn từ dễ nhớ hơn mà không hề yếu

Kéo núm "số từ trong cụm từ" và nhìn hàng cuối bảng. Một cụm bốn từ lấy máy móc từ danh sách 2048 từ có entropy đúng bằng 4 × log2(2048) = 44 bit, tròn trịa không lẻ, vì 2048 chính là 2 mũ 11. So với mật khẩu 8 chữ thường 37,60 bit thì cụm bốn từ mạnh hơn, mà lại dễ nhớ hơn hẳn.

Nhưng phải nói cho hết. Cụm bốn từ thua 8 ký tự lấy đều từ đủ 95 bộ, vốn được 52,56 bit; và trước một dàn card đồ hoạ thì chính cụm bốn từ ấy chỉ trụ được 8,8 giây. Muốn vượt mốc 8 ký tự đủ loại thì cần năm từ. Sáu từ cho 66 bit, tức 12 thế kỷ trước máy để bàn, mà vẫn đọc thành một câu buồn cười dễ thuộc. Cái lợi thật sự của cụm từ không nằm ở chỗ nó mạnh nhất, mà ở chỗ bạn thật sự nhớ nổi nó nên bạn sẽ thật sự dùng nó, thay vì đặt một mật khẩu "phức tạp" ngắn rồi dùng lại ở mười nơi.

Mấy mẹo quen thuộc gần như không thêm gì

Khung cuối sim liệt kê bốn mẹo hầu như ai cũng từng dùng: thay a bằng @, thêm bốn chữ số năm sinh, chấm một dấu chấm than ở cuối, viết hoa chữ cái đầu. Cột bên phải là trần lý thuyết, tức phần bit nhiều nhất mà mẹo đó có thể thêm nếu lựa chọn đằng sau nó thật sự ngẫu nhiên: 3 bit, 13,29 bit, 5,04 bit và 1 bit. Cộng cả bốn được 22,33 bit, vẫn ít hơn 23,82 bit mà bạn nhận được chỉ bằng cách thêm bốn ký tự ngẫu nhiên vào bảng chữ 62.

Và cái trần đó thì không ai với tới. Phần mềm dò mật khẩu có sẵn đúng bốn mẹo này trong bộ luật biến đổi của nó: nó lấy một từ trong từ điển rồi tự động thử mọi kiểu thay chữ, tự động gắn thêm bốn chữ số, tự động thêm dấu chấm than. Bạn nghĩ mình vừa làm mật khẩu khó hơn tám lần, còn máy thì coi đó là tám lần thử.

Sim này tính được gì và không tính được gì

Mọi con số trong sim đều đúng, với đúng một điều kiện: mật khẩu phải được máy sinh ngẫu nhiên đều, nghĩa là cả NL chuỗi đều có cùng khả năng xuất hiện. Chỉ khi đó kẻ tấn công mới không có chỗ nào để bắt đầu tốt hơn là dò lần lượt.

Mật khẩu bạn tự nghĩ ra không như vậy. Nó thường là một từ có nghĩa, một cái tên, một ngày tháng, kèm vài biến đổi quen thuộc. Kẻ tấn công dò từ điển và dò theo mẫu trước, nên với mật khẩu tự nghĩ, con số của sim là chặn trên lạc quan chứ không phải ước lượng. Một chuỗi trông rất "phức tạp" như P@ssw0rd2003! có 13 ký tự và sim sẽ nói nó hơn 85 bit, còn thực tế nó nằm trong mọi danh sách mật khẩu phổ biến và bị dò ra gần như tức thì. Sim không đọc được nội dung mật khẩu, vì thế nó không có ô để bạn gõ mật khẩu vào, và bạn cũng đừng bao giờ gõ mật khẩu đang dùng vào bất kỳ trang đo độ mạnh nào trên mạng.

Thời gian dò còn phụ thuộc một thứ nữa mà người dùng không hề biết và sim cũng không mô hình hoá: cách dịch vụ lưu mật khẩu. Nếu họ dùng một hàm băm chậm và có muối, cùng một dàn máy chỉ đoán được vài nghìn lần mỗi giây; nếu họ dùng một hàm băm nhanh không muối, cũng dàn máy đó đoán hàng tỉ lần mỗi giây. Ba tốc độ trong sim là giả định tròn số để so sánh, không phải số đo của một hệ thống cụ thể nào.

Cuối cùng, năm bậc "rất yếu" tới "rất mạnh" và các mốc 40, 60, 80, 100 bit là quy ước chọn cho bài học này để cái thanh có chữ mà đọc, không phải một tiêu chuẩn ai đó ban hành. Đừng để một con số lớn trên màn hình làm bạn yên tâm: điều duy nhất sim chứng minh được là phép tính, không phải sự an toàn của bạn.

Điều rút ra

Entropy cộng dồn theo độ dài và chỉ cộng một lần theo bề rộng bảng chữ. Vì thế lời khuyên thực dụng là: cứ dài trước đã, rồi mới tính tới ký hiệu, và tốt nhất là để trình quản lý mật khẩu sinh ngẫu nhiên hộ, vì mọi con số ở trên chỉ đúng khi việc chọn là ngẫu nhiên thật. Với những mật khẩu buộc phải tự nhớ, hãy dùng một cụm nhiều từ thay cho một từ ngắn có gắn thêm mẹo, bởi mẹo thì máy đã biết hết còn độ dài thì không.

:::caution Bốn thói quen nền tảng Mật khẩu mạnh và riêng cho từng nơi; bật xác thực hai lớp (ưu tiên ứng dụng xác thực hơn mã qua tin nhắn); bật tự động cập nhật; chỉ cài phần mềm từ nguồn chính thức. Làm một lần, bảo vệ lâu dài. :::

Dấu chân số

Dấu chân số là toàn bộ dấu vết dữ liệu bạn để lại khi hoạt động trên mạng. Có hai loại: chủ động do bạn cố ý tạo ra (bài đăng, bình luận, ảnh chia sẻ) và thụ động do hệ thống tự thu thập (lịch sử duyệt web, vị trí, cookie). Điều cần nhớ là dấu chân số gần như không thể xóa hết: một bức ảnh đã đăng có thể bị người khác lưu lại, một bình luận thiếu suy nghĩ có thể bị chụp màn hình và lan truyền nhiều năm sau.

Nguyên tắc vàng: trước khi đăng bất cứ điều gì, hãy tự hỏi liệu mình có thoải mái khi điều đó được cả thế giới nhìn thấy mãi mãi hay không. Nhà tuyển dụng, thầy cô, thậm chí cơ quan tuyển sinh đều có thể tìm thấy dấu chân số của bạn.

Nhận diện phishing và deepfake

Phần lớn vụ mất tài khoản hay mất tiền không đến từ tấn công kỹ thuật phức tạp, mà từ đánh lừa tâm lý con người. Lừa đảo giả mạo (phishing) là chiêu gửi email, tin nhắn hoặc trang web giả mạo một tổ chức uy tín nhằm dụ bạn cung cấp mật khẩu, mã xác thực hoặc bấm vào liên kết độc hại.

Các dấu hiệu thường gặp:

  • địa chỉ người gửi lạ hoặc gần giống tên thật nhưng sai một chút;
  • lời chào chung chung không gọi đúng tên bạn;
  • nội dung tạo cảm giác khẩn cấp (tài khoản sắp bị khóa, trúng thưởng, phải xác nhận ngay);
  • liên kết dẫn tới địa chỉ lạ, tệp đính kèm bất thường, văn phong lủng củng.

Gần đây nổi lên deepfake, tức dùng AI tạo hình ảnh, giọng nói hoặc video giả mạo người thật rất giống. Kẻ xấu có thể giả giọng người thân để gọi vay tiền. Nguyên tắc phòng tránh là luôn xác minh qua một kênh khác (gọi lại số đã biết, hỏi một thông tin chỉ hai người biết) trước khi chuyển tiền hay làm theo yêu cầu khẩn cấp.

:::danger Không bao giờ đọc mã OTP cho ai Không một tổ chức uy tín nào yêu cầu bạn cung cấp mật khẩu hay mã xác thực (OTP) qua điện thoại, tin nhắn hay email. Bất kỳ ai hỏi mã OTP của bạn đều là kẻ lừa đảo, kể cả khi họ tự xưng là nhân viên ngân hàng hay công an. :::

Phần trên chỉ tóm lược các dấu hiệu để bạn nhận ra và tránh; muốn đào sâu thì đọc bài An ninh mạng và an toàn thông tin trong kỷ nguyên AI của môn Đạo đức và pháp luật AI, nơi có bài tập phân loại từng tình huống là an toàn hay lừa đảo, phần rủi ro khi dán dữ liệu vào công cụ AI, và trách nhiệm pháp lý của người dùng kèm số hiệu luật cụ thể.

Liêm chính học thuật và đạo văn

Liêm chính học thuật là thực hiện hoạt động học tập một cách trung thực, công bằng, có trách nhiệm và tôn trọng công sức người khác. Nó là nền tảng của giá trị tấm bằng: khi một sinh viên gian lận, người đó tự đánh mất cơ hội học thật và làm giảm uy tín mà xã hội đặt vào tấm bằng.

Đạo văn là dùng ý tưởng, câu chữ, dữ liệu hay sản phẩm của người khác mà không ghi nhận nguồn phù hợp. Nhiều bạn đạo văn không vì cố ý mà vì không biết cách trích dẫn đúng. Hai kỹ năng phòng tránh quan trọng nhất:

  • Trích dẫn đúng: ghi rõ nguồn theo một chuẩn nhất quán (ví dụ APA) cho mọi ý tưởng, số liệu hay câu chữ vay mượn. Công cụ như Zotero giúp lưu nguồn và tạo trích dẫn tự động.
  • Diễn đạt lại: không phải thay vài từ đồng nghĩa, mà là đọc hiểu thật sự, gấp tài liệu lại, viết lại bằng ngôn ngữ của riêng mình, rồi vẫn ghi nhận nguồn ý tưởng.

:::caution Tỷ lệ tương đồng không phải tỷ lệ đạo văn Phần mềm kiểm tra đạo văn (Turnitin) cho ra một tỷ lệ tương đồng. Tỷ lệ cao có thể do trích dẫn hợp lệ hoặc thuật ngữ chuyên ngành; ngược lại một bài đạo văn ý tưởng tinh vi có thể tỷ lệ thấp. Đừng tìm mẹo lách phần mềm, hãy tập trung viết trung thực. :::

Mục này mới chỉ dừng ở mức khái niệm và hai kỹ năng cơ bản; bài Liêm chính học thuật và tự chủ trí tuệ thời AI của môn Đạo đức và pháp luật AI đào sâu đúng chủ đề này, với một phổ tương tác giúp bạn định vị cách dùng AI của mình từ hỗ trợ hợp lệ tới gian lận, cách khai báo khi được yêu cầu, và cách giữ tư duy phản biện khi máy làm hộ gần hết.

Đạo đức và pháp luật khi dùng AI tại Việt Nam

Câu hỏi đạo đức mới: dùng AI tới đâu thì còn là học thật, tới đâu thì thành gian lận? Nguyên tắc xuyên suốt là minh bạch. Nếu được phép dùng AI, hãy khai báo rõ đã dùng công cụ nào, cho phần việc nào, ở mức độ nào. AI là công cụ, không phải tác giả, nên bạn chịu trách nhiệm về sản phẩm cuối. Điều này dẫn tới hai nghĩa vụ: kiểm chứng (AI có thể "ảo giác", bịa ra thông tin nghe hợp lý nhưng sai) và nhận thức thiên kiến (AI học từ dữ liệu của con người nên có thể tái tạo định kiến).

Về pháp luật Việt Nam, một số hành vi tưởng vô hại nhưng có thể vi phạm: tải và chia sẻ phim, nhạc, phần mềm lậu; đăng lại ảnh hay bài viết của người khác mà không xin phép; chia sẻ thông tin cá nhân của người khác khi chưa được đồng ý; lan truyền tin giả. Luật Sở hữu trí tuệ, Luật An ninh mạng và nghị định về bảo vệ dữ liệu cá nhân đều ràng buộc hành vi trên không gian mạng.

Hai đoạn trên chỉ là bản tóm lược để bạn có thái độ đúng ngay từ năm nhất. Phần đạo đức được đào sâu ở bài Nền tảng đạo đức trong sử dụng AI, với năm nguyên tắc cốt lõi dựng thành một cây quyết định sáu câu hỏi để tự hỏi trước khi giao việc cho AI. Phần pháp luật được đào sâu ở bài Pháp luật về AI và dữ liệu cá nhân, nơi nêu số hiệu từng luật cùng ba mức rủi ro của hệ thống AI và các quyền cụ thể của bạn với dữ liệu cá nhân.

Tự kiểm Module 60/6 đúngchưa trả lời
  1. 1Bạn nhận email tự xưng từ ngân hàng, gọi bạn là "Quý khách hàng thân mến", báo tài khoản sẽ bị khóa trong hai giờ nếu không bấm liên kết và nhập mã OTP. Đây là gì?
  2. 2Một người gọi điện tự xưng là nhân viên ngân hàng, yêu cầu bạn đọc mã OTP vừa nhận để "xác minh". Bạn nên làm gì?
  3. 3Vì sao mỗi tài khoản quan trọng nên có một mật khẩu riêng?
  4. 4Một bạn lấy đoạn dài từ bài báo, đổi vài từ rồi nộp mà không ghi nguồn, cho rằng "đã viết lại nên không phải đạo văn". Nhận định đúng là gì?
  5. 5Phát biểu nào đúng về dấu chân số?
  6. 6Khi dùng ChatGPT gợi ý dàn ý và sửa lỗi diễn đạt cho bài luận, cách làm đúng về đạo đức AI là gì?