Bảng tra thuật ngữ
Bảng tra thuật ngữ
Bạn đang đọc một bài báo NLP và vấp phải một từ viết tắt. Trang này để tra trong mười giây rồi quay lại chỗ đang đọc, chứ không phải để đọc từ đầu tới cuối.
Mỗi mục ở đây gồm bốn thứ: tên tiếng Việt, tên tiếng Anh đúng như nó xuất hiện trong bài báo, một câu định nghĩa, và đường dẫn tới bài trong sách dạy kỹ thuật ngữ đó. Định nghĩa cố ý ngắn. Nếu một câu chưa đủ thì bạn cần bài dạy chứ không cần một câu dài hơn, và nút liên kết nằm ngay dưới mỗi thẻ.
Ô tìm kiếm quét đồng thời tên tiếng Việt, tên tiếng Anh và cả nội dung định nghĩa, sau khi đã bỏ dấu và bỏ phân biệt hoa thường. Nhờ vậy gõ levenshtein ra được mục Khoảng cách chỉnh sửa dù chữ đó chỉ nằm trong phần định nghĩa, và gõ dong xuat hien không dấu vẫn ra Đồng xuất hiện. Bộ lọc chương thu hẹp về đúng một chương, hai nút sắp xếp đổi giữa thứ tự chữ cái và thứ tự chương, còn nút Xoá bộ lọc trả cả ba thứ đó về mặc định cùng lúc. Con số bên phải thanh công cụ luôn là số thẻ thật đang hiển thị, không có chuyện danh sách bị cắt bớt phía sau.
- Âm tiếtSyllableC8 · Cạm bẫy
Đơn vị viết cách nhau bằng dấu trắng trong tiếng Việt. Tách theo âm tiết cho nhiều token hơn tách theo từ ghép, nên mọi độ đo đếm cụm đều đổi theo.
Mở bài dạy thuật ngữ này - Âm tính giảFalse negativeC5 · Phân loại
Mẫu thuộc lớp đang xét nhưng bị bỏ sót. Nó làm hỏng recall.
Mở bài dạy thuật ngữ này - Bậc hiệu dụngEffective n-gram orderC8 · Cạm bẫy
Quy ước bỏ khỏi trung bình nhân của BLEU những bậc mà câu quá ngắn để có cụm. Không có nó thì mọi câu ngắn đều nhận điểm 0.
Mở bài dạy thuật ngữ này - Bão hoà tần suấtTerm frequency saturationC7 · Truy hồi
Việc điểm của một từ khoá bò lên một cái trần rồi dừng khi số lần xuất hiện tăng, thay vì tăng tuyến tính mãi như tf-idf.
Mở bài dạy thuật ngữ này - Bề rộng chùm tiaBeam widthC4 · Mô hình ngôn ngữ
Số chuỗi ứng viên giữ lại ở mỗi bước, ký hiệu B. B bằng 1 chính là giải mã tham lam.
Mở bài dạy thuật ngữ này - BERTScoreBERTScoreC6 · Văn bản sinh ra
Cách chấm ghép từng token của hai câu bằng cosine giữa vector nhúng, thay vì đòi trùng đúng mặt chữ.
Mở bài dạy thuật ngữ này - BLEUBLEUC6 · Văn bản sinh ra
Độ đo dịch máy, lấy trung bình nhân của độ chính xác cụm bậc 1 tới 4 rồi nhân với hệ số phạt câu ngắn.
Mở bài dạy thuật ngữ này - BLEU mức câuSentence-level BLEUC8 · Cạm bẫy
BLEU chấm cho từng câu riêng lẻ thay vì cho cả tập. Rất hay sụp về 0, vì chỉ cần một bậc cụm trượt sạch là trung bình nhân về 0.
Mở bài dạy thuật ngữ này - BM25Okapi BM25C7 · Truy hồi
Hàm xếp hạng tài liệu dựng trên tf-idf nhưng thêm bão hoà tần suất và phạt tài liệu dài. Hai núm của nó là k1 và b.
Mở bài dạy thuật ngữ này - Bỏ dấu câuPunctuation strippingC8 · Cạm bẫy
Gỡ dấu chấm và dấu phẩy khỏi văn bản trước khi tách. Giữ lại thì một dấu phẩy giữa câu đủ để chặt đôi một cụm bốn từ.
Mở bài dạy thuật ngữ này - Bước hợp nhấtMerge stepC1 · Token
Một lần dán cặp ký hiệu của BPE. Số bước hợp nhất chính là núm chỉnh kích thước từ vựng, mỗi bước thêm đúng một mục.
Mở bài dạy thuật ngữ này - Cắt cứng theo tokenFixed-size chunkingC7 · Truy hồi
Cắt tài liệu tại đúng từng mốc token đều nhau, bất kể mốc đó rơi vào giữa câu hay không. Khối đều tăm tắp, đổi lại câu bị chẻ đôi.
Mở bài dạy thuật ngữ này - Cắt ngọnClippingC6 · Văn bản sinh ra
Giới hạn số lần đếm một cụm ở mức nó xuất hiện trong câu tham chiếu, để việc lặp một từ đúng không thổi điểm lên.
Mở bài dạy thuật ngữ này - Cắt theo câuSentence-aware chunkingC7 · Truy hồi
Gom trọn từng câu vào khối, thêm câu chừng nào chưa vượt kích thước đặt ra. Không câu nào bị chẻ, đổi lại khối dài ngắn lệch nhau.
Mở bài dạy thuật ngữ này - Câu tham chiếuReferenceC6 · Văn bản sinh ra
Bản do người viết, dùng làm chuẩn để chấm bản do máy sinh. Có nhiều bản tham chiếu thì điểm thường cao hơn.
Mở bài dạy thuật ngữ này - Chấm theo spanSpan-level scoringC5 · Phân loại
Chỉ tính đúng khi cả biên lẫn loại của thực thể khớp hoàn toàn. Khắc nghiệt hơn chấm theo token, lệch một token là mất trọn.
Mở bài dạy thuật ngữ này - Chiết khấu theo logLogarithmic discountC7 · Truy hồi
Cách chia lợi ích của mỗi kết quả cho một hàm log của thứ hạng, để kết quả nằm càng sâu càng đóng góp ít. Đây là chữ D trong DCG.
Mở bài dạy thuật ngữ này - Chọn quả anh đàoCherry-pickingC8 · Cạm bẫy
Thử nhiều bộ quy ước rồi chỉ báo cáo bộ cho điểm đẹp nhất. Nguy hiểm vì không cần nói dối câu nào, bảng liệt kê mọi tổ hợp chính là bảng để chọn.
Mở bài dạy thuật ngữ này - Chồng lấn chunkChunk overlapC7 · Truy hồi
Số token mà hai khối liền nhau cùng giữ, để một câu bị mốc cắt chẻ đôi vẫn còn nguyên ở một khối nào đó. Đổi lại kho vector phình ra.
Mở bài dạy thuật ngữ này - Chữ ký độ đoMetric signatureC8 · Cạm bẫy
Chuỗi ghi phiên bản và toàn bộ tuỳ chọn của bộ chấm, dán kèm kết quả. Không có nó thì người đọc không biết con số sinh ra từ quy ước nào.
Mở bài dạy thuật ngữ này - Chuẩn hoá độ dài tài liệuDocument length normalizationC7 · Truy hồi
Hạ điểm tài liệu dài để nó không thắng chỉ vì chứa nhiều từ hơn. Trong BM25 phần này nằm ở mẫu số và do tham số b điều khiển.
Mở bài dạy thuật ngữ này - Chuẩn hoá L2L2 normalizationC2 · Biểu diễn
Chia vector cho độ dài Euclid của nó để tài liệu dài và tài liệu ngắn so được với nhau.
Mở bài dạy thuật ngữ này - Chuẩn hoá Unicode NFCUnicode NFC normalizationC8 · Cạm bẫy
Gom chữ và dấu thành một mã duy nhất. Không chuẩn hoá thì hai chữ hiện giống hệt nhau trên màn hình vẫn có thể là hai token khác nhau.
Mở bài dạy thuật ngữ này - ChunkChunkC7 · Truy hồi
Khối văn bản nhỏ mà tài liệu bị cắt ra trước khi đưa vào kho truy hồi. Bộ truy hồi trả về chunk chứ không trả về cả tài liệu.
Mở bài dạy thuật ngữ này - Cohen kappaCohen kappaC8 · Cạm bẫy
Độ đo đồng thuận đã trừ phần may rủi, bằng Po trừ Pe rồi chia cho 1 trừ Pe. Nằm trong đoạn từ -1 tới 1 và hoàn toàn có thể âm.
Mở bài dạy thuật ngữ này - Cross-entropyCross-entropyC4 · Mô hình ngôn ngữ
Trung bình của log âm xác suất mà mô hình gán cho từng token thật. Đơn vị phụ thuộc cơ số log.
Mở bài dạy thuật ngữ này - Cửa sổ ngữ cảnhContext windowC3 · Ngữ cảnh
Số từ tính sang trái và sang phải được coi là hàng xóm. Cửa sổ hẹp bắt quan hệ cú pháp, cửa sổ rộng bắt quan hệ chủ đề.
Mở bài dạy thuật ngữ này - Dạng từTypeC1 · Token
Một từ khác nhau trong ngữ liệu, đếm một lần dù xuất hiện bao nhiêu lần. Đối lập với token, vốn đếm từng lần xuất hiện.
Mở bài dạy thuật ngữ này - Dãy con chung dài nhấtLongest common subsequence (LCS)C6 · Văn bản sinh ra
Dãy dài nhất xuất hiện trong cả hai chuỗi theo đúng thứ tự, cho phép có khoảng cách giữa các phần tử.
Mở bài dạy thuật ngữ này - DCG lý tưởngIdeal DCG (IDCG)C7 · Truy hồi
DCG của chính danh sách đó sau khi xếp giảm dần theo mức liên quan. Nó là mẫu số của nDCG, nên đổi quy ước gain là đổi luôn nDCG.
Mở bài dạy thuật ngữ này - Điểm F-betaF-beta scoreC6 · Văn bản sinh ra
Trung bình điều hoà có trọng số giữa precision và recall. Beta lớn hơn 1 kéo công thức về phía recall.
Mở bài dạy thuật ngữ này - Điểm F1F1 scoreC5 · Phân loại
Trung bình điều hoà của precision và recall. Chỉ cao khi cả hai cùng cao, một con số thấp là đủ kéo F1 xuống.
Mở bài dạy thuật ngữ này - Định luật ZipfZipf's lawC1 · Token
Quan sát rằng tần suất của từ tỉ lệ nghịch với thứ hạng của nó. Hệ quả là một đuôi rất dài gồm những từ chỉ xuất hiện một lần.
Mở bài dạy thuật ngữ này - Độ bao phủRecallC5 · Phân loại
Trong những mẫu thật sự thuộc lớp, bao nhiêu phần được tìm ra. Trả lời câu hỏi mô hình bỏ sót nhiều không.
Mở bài dạy thuật ngữ này - Độ bao phủ tại kRecall at kC7 · Truy hồi
Tỉ lệ tài liệu liên quan được lọt vào k kết quả đầu, trên tổng số tài liệu liên quan có trong kho.
Mở bài dạy thuật ngữ này - Độ chính xácPrecisionC5 · Phân loại
Trong những mẫu được đoán là thuộc lớp, bao nhiêu phần đúng. Trả lời câu hỏi mô hình có hay nói bừa hay không.
Mở bài dạy thuật ngữ này - Độ chính xác cụm bậc nModified n-gram precisionC6 · Văn bản sinh ra
Tỉ lệ cụm n từ của câu máy có mặt trong câu tham chiếu, sau khi đã cắt ngọn số lần lặp.
Mở bài dạy thuật ngữ này - Độ chính xác tại kPrecision at kC7 · Truy hồi
Tỉ lệ kết quả liên quan trong k kết quả đầu. Bỏ qua hoàn toàn những gì nằm sau vị trí k.
Mở bài dạy thuật ngữ này - Độ chính xác theo vị tríPositional token accuracyC8 · Cạm bẫy
Tỉ lệ token khớp nhau khi so từng vị trí một giữa hai chuỗi. Lệch một token là mọi thứ phía sau cùng sai, và đó là lý do khoảng cách chỉnh sửa tồn tại.
Mở bài dạy thuật ngữ này - Độ chính xác tổng thểAccuracyC5 · Phân loại
Tỉ lệ mẫu được đoán đúng trên toàn bộ tập. Rất dễ đánh lừa khi các lớp mất cân bằng.
Mở bài dạy thuật ngữ này - Độ dài tài liệu trung bìnhAverage document length (avgdl)C7 · Truy hồi
Số token trung bình của một tài liệu trong kho. BM25 so độ dài từng tài liệu với con số này để biết nó dài hay ngắn bất thường.
Mở bài dạy thuật ngữ này - Độ đồng thuận giữa người chấmInter-annotator agreementC8 · Cạm bẫy
Mức hai người gắn nhãn cùng một dữ liệu trùng nhau. Đây là bằng chứng chính cho việc bộ nhãn có đáng tin hay không.
Mở bài dạy thuật ngữ này - Độ phủ tokenToken coverageC1 · Token
Tỉ lệ token trong văn bản được từ vựng phủ được. Giữ K từ hay gặp nhất đã phủ phần lớn văn bản vì phân bố từ rất lệch.
Mở bài dạy thuật ngữ này - Độ thưaSparsityC2 · Biểu diễn
Tỉ lệ ô bằng 0 trong ma trận đếm. Bậc n càng cao thì độ thưa càng gần 1, và mô hình càng thiếu bằng chứng để học.
Mở bài dạy thuật ngữ này - Độ tương tự cosineCosine similarityC2 · Biểu diễn
Cosin của góc giữa hai vector. Chỉ nhìn hướng chứ không nhìn độ lớn, nên tài liệu dài ngắn khác nhau vẫn so được.
Mở bài dạy thuật ngữ này - Đồng thuận do may rủiChance agreement (Pe)C8 · Cạm bẫy
Phần trùng nhau mà hai người vẫn đạt được nếu mỗi người rút nhãn ngẫu nhiên theo đúng tần suất của mình. Trên dữ liệu lệch nhãn nó rất cao.
Mở bài dạy thuật ngữ này - Đồng thuận quan sát đượcObserved agreement (Po)C8 · Cạm bẫy
Tỉ lệ trường hợp hai người chấm gắn cùng một nhãn. Dễ tính, dễ trích dẫn, và gần như vô nghĩa nếu không kèm theo Pe.
Mở bài dạy thuật ngữ này - Đồng xuất hiệnCo-occurrenceC3 · Ngữ cảnh
Số lần hai từ cùng nằm trong một cửa sổ ngữ cảnh. Số đếm thô luôn thiên vị từ phổ biến.
Mở bài dạy thuật ngữ này - Dương tính giảFalse positiveC5 · Phân loại
Mẫu không thuộc lớp đang xét nhưng bị đoán là thuộc lớp đó. Nó làm hỏng precision.
Mở bài dạy thuật ngữ này - Dương tính thậtTrue positiveC5 · Phân loại
Mẫu thuộc lớp đang xét và được đoán đúng là thuộc lớp đó. Là tử số chung của cả precision lẫn recall.
Mở bài dạy thuật ngữ này - Đường truy vếtBacktraceC6 · Văn bản sinh ra
Đường đi ngược từ ô cuối về ô đầu của bảng quy hoạch động, cho biết cụ thể đã chèn, xoá hay thay thế ở đâu.
Mở bài dạy thuật ngữ này - Fleiss kappaFleiss kappaC8 · Cạm bẫy
Mở rộng của kappa cho nhiều hơn hai người chấm. Cohen kappa chỉ dựng được cho đúng hai người nên gặp ba người trở lên là phải đổi thước.
Mở bài dạy thuật ngữ này - Giả định độc lập ngây thơNaive independence assumptionC5 · Phân loại
Coi các từ độc lập với nhau khi đã biết lớp. Sai rành rành với ngôn ngữ thật, nhưng vẫn cho bộ phân loại chạy tốt bất ngờ.
Mở bài dạy thuật ngữ này - Giả thuyết phân bốDistributional hypothesisC3 · Ngữ cảnh
Ý tưởng rằng từ nào hay xuất hiện trong cùng loại ngữ cảnh thì có nghĩa gần nhau. Nền móng của mọi vector nhúng.
Mở bài dạy thuật ngữ này - Giải mãDecodingC4 · Mô hình ngôn ngữ
Bước biến phân phối xác suất của mô hình thành một chuỗi chữ cụ thể. Cùng một mô hình, đổi cách giải mã là đổi kết quả.
Mở bài dạy thuật ngữ này - Giải mã chùm tiaBeam searchC4 · Mô hình ngôn ngữ
Giữ song song B chuỗi tốt nhất ở mỗi bước thay vì một. Vẫn không bảo đảm tìm ra chuỗi có xác suất cao nhất.
Mở bài dạy thuật ngữ này - Giải mã tham lamGreedy decodingC4 · Mô hình ngôn ngữ
Mỗi bước chọn luôn token có xác suất cao nhất. Nhanh, nhưng một lựa chọn tốt trước mắt có thể dẫn vào nhánh tệ.
Mở bài dạy thuật ngữ này - Gom cụm k-meansk-means clusteringC3 · Ngữ cảnh
Thuật toán chia điểm thành k nhóm quanh k tâm. Dùng ở đây để xem các câu cùng một nghĩa có tự tụ lại thành khối hay không.
Mở bài dạy thuật ngữ này - Hạ chữ thườngLowercasingC8 · Cạm bẫy
Đưa mọi chữ về chữ thường trước khi tách token, để một chữ viết hoa đầu câu không bị coi là token khác với chính nó viết thường.
Mở bài dạy thuật ngữ này - Hệ số chồng lấnOverlap coefficientC2 · Biểu diễn
Kích thước giao chia cho kích thước tập nhỏ hơn. Một tập con của tập kia luôn đạt 1, nên độ đo này rất dễ bị thổi.
Mở bài dạy thuật ngữ này - Hệ số JaccardJaccard indexC2 · Biểu diễn
Kích thước giao chia cho kích thước hợp của hai tập từ. Chỉ quan tâm có mặt hay không, không quan tâm số lần.
Mở bài dạy thuật ngữ này - Hệ số phìnhChunk expansion factorC7 · Truy hồi
Tổng token sau khi cắt chia cho tổng token gốc. Bằng 1 khi không chồng lấn, và nó chính là hoá đơn tiền nhúng cùng tiền lưu trữ.
Mở bài dạy thuật ngữ này - idf trơnSmoothed idfC2 · Biểu diễn
Biến thể cộng thêm hằng số vào mẫu số và vào kết quả, để từ phổ biến không bị dập hẳn về 0. Một trong nhiều biến thể tf-idf.
Mở bài dạy thuật ngữ này - Kappa có trọng sốWeighted kappaC8 · Cạm bẫy
Biến thể phạt nhẹ khi hai người lệch nhau một bậc và phạt nặng khi lệch nhiều bậc. Dùng cho nhãn có thứ tự, chẳng hạn thang một tới năm sao.
Mở bài dạy thuật ngữ này - Khoảng cách chỉnh sửaEdit distanceC6 · Văn bản sinh ra
Số thao tác chèn, xoá, thay thế ít nhất để biến chuỗi này thành chuỗi kia. Còn gọi là khoảng cách Levenshtein.
Mở bài dạy thuật ngữ này - Khớp dài nhất từ trái sangForward longest matchingC8 · Cạm bẫy
Cách tách từ quét một chiều, mỗi vị trí lấy mục dài nhất khớp được trong từ điển rồi nhảy qua. Không quay lui nên có câu nó đọc sai.
Mở bài dạy thuật ngữ này - Khớp một phầnPartial matchC5 · Phân loại
Quy ước cho điểm khi span đoán chồng lấn span thật mà không trùng khít. Nới tay hơn khớp tuyệt đối nhưng khó so giữa các bài báo.
Mở bài dạy thuật ngữ này - Khử nhập nhằng nghĩaWord sense disambiguationC3 · Ngữ cảnh
Bài toán chọn đúng nghĩa của một từ đa nghĩa dựa vào câu chứa nó.
Mở bài dạy thuật ngữ này - Kích thước chunkChunk sizeC7 · Truy hồi
Số token tối đa của một khối. Nó quyết định các mốc cắt rơi vào đâu, và không có giá trị nào đúng cho mọi tài liệu.
Mở bài dạy thuật ngữ này - Kích thước từ vựngVocabulary sizeC1 · Token
Số mục trong từ vựng. Lớn thì chuỗi token ngắn lại nhưng bảng nhúng phình to, nhỏ thì ngược lại.
Mở bài dạy thuật ngữ này - Krippendorff alphaKrippendorff's alphaC8 · Cạm bẫy
Độ đo đồng thuận chịu được nhiều người chấm, dữ liệu thiếu và nhiều loại thang nhãn. Là lựa chọn thay thế khi kappa không đủ dùng.
Mở bài dạy thuật ngữ này - Ký hiệu kết thúc từEnd-of-word markerC1 · Token
Ký hiệu gắn vào cuối mỗi từ trước khi chạy BPE, nhờ đó một hậu tố nằm cuối từ được học thành mảnh riêng, khác với cùng chữ đó nằm giữa từ.
Mở bài dạy thuật ngữ này - Làm mượtSmoothingC4 · Mô hình ngôn ngữ
Lấy bớt khối lượng xác suất của các cụm đã thấy để chia cho các cụm chưa thấy, đổi lấy việc không còn xác suất 0.
Mở bài dạy thuật ngữ này - Làm mượt add-kAdd-k smoothingC4 · Mô hình ngôn ngữ
Cộng k vào mọi số đếm trước khi chia. k càng lớn thì phân phối càng phẳng và mô hình càng mất cấu trúc học được.
Mở bài dạy thuật ngữ này - Làm mượt LaplaceLaplace smoothingC5 · Phân loại
Cộng alpha vào mọi số đếm từ. Với alpha bằng 0, một từ chưa từng thấy trong lớp làm cả tích về 0 và lớp đó chết hẳn.
Mở bài dạy thuật ngữ này - Lấy mẫu top-kTop-k samplingC4 · Mô hình ngôn ngữ
Chỉ giữ k ứng viên có xác suất cao nhất rồi chuẩn hoá lại. Số ứng viên cố định bất kể phân phối nhọn hay phẳng.
Mở bài dạy thuật ngữ này - Lấy mẫu top-pNucleus sampling (top-p)C4 · Mô hình ngôn ngữ
Giữ nhóm ứng viên nhỏ nhất có tổng xác suất đạt ngưỡng p. Số ứng viên tự co giãn theo độ nhọn của phân phối.
Mở bài dạy thuật ngữ này - LLM làm giám khảoLLM as a judgeC8 · Cạm bẫy
Cách dùng một mô hình ngôn ngữ để chấm thay người. Mức khớp với người chấm ở đây cũng phải trừ may rủi, nếu không con số sẽ đẹp giả.
Mở bài dạy thuật ngữ này - LogitLogitC4 · Mô hình ngôn ngữ
Điểm số thô mà mô hình gán cho từng ứng viên trước khi chuẩn hoá thành xác suất. Chỉ hiệu giữa các logit mới có ý nghĩa.
Mở bài dạy thuật ngữ này - Lợi ích tích luỹ chiết khấuDiscounted cumulative gain (DCG)C7 · Truy hồi
Tổng mức liên quan của các kết quả, mỗi cái chia cho một hàm log của thứ hạng, nên xếp sai chỗ càng cao càng bị trừ nặng.
Mở bài dạy thuật ngữ này - Lùi bậcBackoffC4 · Mô hình ngôn ngữ
Khi ngữ cảnh dài chưa từng xuất hiện thì rút ngắn ngữ cảnh lại và dùng mô hình bậc thấp hơn.
Mở bài dạy thuật ngữ này - Lược đồ BIOBIO tagging schemeC5 · Phân loại
Cách gán nhãn theo token: B mở đầu một thực thể, I nằm trong thực thể đang mở, O nằm ngoài mọi thực thể.
Mở bài dạy thuật ngữ này - Mã hoá cặp byteByte pair encoding (BPE)C1 · Token
Thuật toán học từ vựng mảnh: lặp lại việc dán cặp ký hiệu kề nhau hay đi cùng nhau nhất thành một ký hiệu mới.
Mở bài dạy thuật ngữ này - Ma trận nhầm lẫnConfusion matrixC5 · Phân loại
Bảng đếm số mẫu theo cặp nhãn thật và nhãn đoán. Mọi độ đo phân loại đều đọc ra được từ bảng này.
Mở bài dạy thuật ngữ này - Ma trận tài liệu và từDocument-term matrixC2 · Biểu diễn
Bảng mà mỗi hàng là một tài liệu, mỗi cột là một từ hoặc một n-gram, mỗi ô là số lần xuất hiện.
Mở bài dạy thuật ngữ này - Macro F1Macro-averaged F1C5 · Phân loại
Tính F1 riêng cho từng lớp rồi lấy trung bình cộng. Lớp hiếm có tiếng nói ngang lớp phổ biến, nên số thường thấp hơn micro.
Mở bài dạy thuật ngữ này - Mảnh từSubwordC1 · Token
Token nhỏ hơn một từ, học được từ ngữ liệu. Từ lạ vỡ thành các mảnh quen nên gần như không còn từ nằm ngoài từ vựng.
Mở bài dạy thuật ngữ này - Micro F1Micro-averaged F1C5 · Phân loại
Gộp số đếm của mọi lớp lại rồi mới tính F1 một lần. Trong bài toán đơn nhãn đa lớp, nó luôn bằng đúng accuracy.
Mở bài dạy thuật ngữ này - Mô hình n-gramn-gram language modelC4 · Mô hình ngôn ngữ
Mô hình ngôn ngữ chỉ nhìn n trừ 1 token gần nhất làm ngữ cảnh. Rẻ và dễ hiểu, nhưng gán xác suất 0 cho mọi cụm chưa từng thấy.
Mở bài dạy thuật ngữ này - Mô hình ngôn ngữLanguage modelC4 · Mô hình ngôn ngữ
Mô hình gán xác suất cho chuỗi token, thường bằng cách dự đoán token kế tiếp từ những token đã có.
Mở bài dạy thuật ngữ này - Mốc cắt kRank cutoff kC7 · Truy hồi
Vị trí mà độ đo dừng lại, chỉ chấm k kết quả đầu. Nó là một bức tường: tài liệu tốt nằm ngay dưới mốc thì hoàn toàn không được tính.
Mở bài dạy thuật ngữ này - Mức liên quanRelevance gradeC7 · Truy hồi
Điểm liên quan của một kết quả với truy vấn, ở đây là thang từ 0 tới 3. Các độ đo nhị phân phải gộp thang đó lại thành có hoặc không.
Mở bài dạy thuật ngữ này - n-gramn-gramC2 · Biểu diễn
Cụm n token liền nhau. Tăng n thì giữ lại được một phần thứ tự từ, đổi lại số cột phình ra và ma trận đếm thưa hẳn đi.
Mở bài dạy thuật ngữ này - Naive Bayes đa thứcMultinomial naive BayesC5 · Phân loại
Bộ phân loại văn bản dựa trên số đếm từ, nhân xác suất từng từ với tiên nghiệm của lớp rồi so hai lớp với nhau.
Mở bài dạy thuật ngữ này - nDCGNormalized DCG (nDCG)C7 · Truy hồi
DCG chia cho DCG của thứ tự lý tưởng, để đưa mọi truy vấn về cùng thang từ 0 tới 1.
Mở bài dạy thuật ngữ này - Nghĩa của từWord senseC3 · Ngữ cảnh
Một cách hiểu cụ thể của một từ đa nghĩa trong một câu cụ thể. Ngữ cảnh xung quanh là manh mối duy nhất để phân biệt.
Mở bài dạy thuật ngữ này - Ngữ liệuCorpusNhập môn
Tập văn bản dùng để huấn luyện hoặc để đo. Mọi con số trong sách đều phụ thuộc vào ngữ liệu, đổi ngữ liệu thì kết quả đổi theo.
Mở bài dạy thuật ngữ này - Nhận dạng thực thể có tênNamed entity recognition (NER)C5 · Phân loại
Bài toán tìm và phân loại các cụm chỉ tên người, tổ chức, địa điểm trong văn bản.
Mở bài dạy thuật ngữ này - Nhập nhằng ranh giới từWord boundary ambiguityC8 · Cạm bẫy
Tình huống một chuỗi âm tiết có nhiều cách gộp thành từ đều hợp lệ. Không từ điển nào tự gỡ được, việc chọn cách đọc vẫn phải do người quyết.
Mở bài dạy thuật ngữ này - NhiệtTemperatureC4 · Mô hình ngôn ngữ
Số chia logit trước khi lấy softmax. Nhỏ hơn 1 làm phân phối nhọn lại, lớn hơn 1 làm nó phẳng ra.
Mở bài dạy thuật ngữ này - PerplexityPerplexityC4 · Mô hình ngôn ngữ
Luỹ thừa của cross-entropy, đọc được như số phương án trung bình mà mô hình còn phân vân. Đổi cơ số log không làm nó đổi.
Mở bài dạy thuật ngữ này - Phạt câu ngắnBrevity penaltyC6 · Văn bản sinh ra
Hệ số nhỏ hơn 1 nhân vào BLEU khi câu máy ngắn hơn câu tham chiếu, chặn mẹo dịch cụt để giữ precision cao.
Mở bài dạy thuật ngữ này - Phạt độ dàiLength penaltyC4 · Mô hình ngôn ngữ
Chia log xác suất cho một hàm của độ dài, để chuỗi dài không bị thiệt chỉ vì cộng thêm nhiều số âm.
Mở bài dạy thuật ngữ này - PMI dươngPositive PMI (PPMI)C3 · Ngữ cảnh
PMI bị cắt phần âm về 0. Ổn định hơn trên ngữ liệu nhỏ, nhưng vứt luôn thông tin về các cặp kỵ nhau và thiên vị cặp hiếm.
Mở bài dạy thuật ngữ này - Quy hoạch độngDynamic programmingC6 · Văn bản sinh ra
Cách giải bài toán bằng cách điền một bảng, mỗi ô chỉ dựa vào vài ô đã điền trước. Bảng khoảng cách chỉnh sửa là ví dụ kinh điển.
Mở bài dạy thuật ngữ này - Quy ước gainGain conventionC7 · Truy hồi
Cách quy mức liên quan thành lợi ích trong DCG, thường là lấy thẳng rel hoặc lấy 2 mũ rel trừ 1. Hai quy ước cho hai con số rất khác nhau.
Mở bài dạy thuật ngữ này - Quy ước tiền xử lýPreprocessing conventionC8 · Cạm bẫy
Những quyết định chạy trước công thức: hạ chữ thường, bỏ dấu câu, tách kiểu gì, chuẩn hoá Unicode hay không. Chúng đổi điểm mà không đổi mô hình.
Mở bài dạy thuật ngữ này - ROUGE-1ROUGE-1C6 · Văn bản sinh ra
Độ trùng từ đơn giữa bản tóm tắt máy và bản tham chiếu, báo theo recall, precision và F.
Mở bài dạy thuật ngữ này - ROUGE-2ROUGE-2C6 · Văn bản sinh ra
Như ROUGE-1 nhưng đếm cụm hai từ liền nhau, nên khắt khe hơn hẳn về trật tự cục bộ.
Mở bài dạy thuật ngữ này - ROUGE-LROUGE-LC6 · Văn bản sinh ra
Dựa trên dãy con chung dài nhất, nên thưởng đúng thứ tự mà không đòi các từ phải liền nhau.
Mở bài dạy thuật ngữ này - sacreBLEUsacreBLEUC8 · Cạm bẫy
Bộ chấm BLEU có bộ tách token cố định và in kèm một chuỗi chữ ký ghi rõ mọi tuỳ chọn, để hai bài báo so được điểm với nhau.
Mở bài dạy thuật ngữ này - Sinh có truy hồiRetrieval-augmented generation (RAG)C7 · Truy hồi
Cách ghép một khâu truy hồi vào trước mô hình sinh, nhồi vài đoạn tài liệu lấy được vào ngữ cảnh. Vì cần nhiều đoạn tốt nên MRR là thước sai cho nó.
Mở bài dạy thuật ngữ này - SoftmaxSoftmaxC4 · Mô hình ngôn ngữ
Phép biến dãy logit thành phân phối xác suất cộng lại bằng 1, bằng cách lấy hàm mũ rồi chia cho tổng.
Mở bài dạy thuật ngữ này - Span thực thểEntity spanC5 · Phân loại
Một cụm token liền nhau tạo thành trọn một thực thể, xác định bởi vị trí đầu, vị trí cuối và loại thực thể.
Mở bài dạy thuật ngữ này - Tách câuSentence splittingC7 · Truy hồi
Bước cắt văn bản thành câu, thường chỉ dựa vào dấu chấm và dấu chấm hỏi. Một chữ viết tắt hay một số thập phân là đủ để đánh lừa nó.
Mở bài dạy thuật ngữ này - Tách theo ký tựCharacter-level tokenizationC8 · Cạm bẫy
Coi mỗi ký tự là một token, kể cả dấu trắng. Không bao giờ gặp từ lạ, đổi lại chuỗi dài ra và các cụm bậc cao gần như mất hết ý nghĩa.
Mở bài dạy thuật ngữ này - Tách tokenTokenizationC1 · Token
Bước cắt chuỗi ký tự thành dãy token. Đây là bước đầu tiên của mọi hệ NLP và là chỗ quyết định mô hình nhìn thấy cái gì.
Mở bài dạy thuật ngữ này - Tách từ tiếng ViệtVietnamese word segmentationC8 · Cạm bẫy
Gộp các âm tiết lại thành từ ghép, chẳng hạn hai âm tiết thành một token duy nhất. Câu ngắn lại nên mỗi từ sai chiếm tỉ trọng lớn hơn và điểm có thể giảm.
Mở bài dạy thuật ngữ này - Tần suất tài liệuDocument frequency (df)C2 · Biểu diễn
Số tài liệu trong kho có chứa một từ, đếm một lần cho mỗi tài liệu bất kể từ đó lặp bao nhiêu lần.
Mở bài dạy thuật ngữ này - Tần suất tài liệu nghịch đảoInverse document frequency (idf)C2 · Biểu diễn
Trọng số hạ thấp từ có mặt ở nhiều tài liệu. Từ có mặt ở mọi tài liệu bị kéo về 0 theo công thức thường.
Mở bài dạy thuật ngữ này - Tần suất từTerm frequency (tf)C2 · Biểu diễn
Số lần một từ xuất hiện trong một tài liệu, có thể để thô hoặc chia cho độ dài tài liệu.
Mở bài dạy thuật ngữ này - tf-idftf-idfC2 · Biểu diễn
Tích của tần suất từ với idf. Cao khi một từ hay gặp trong tài liệu này mà hiếm gặp trong cả kho.
Mở bài dạy thuật ngữ này - Tham số bBM25 length parameter bC7 · Truy hồi
Núm chỉnh mức phạt tài liệu dài của BM25. Bằng 0 thì độ dài rời khỏi công thức, bằng 1 thì phạt theo trọn tỉ số giữa độ dài và avgdl.
Mở bài dạy thuật ngữ này - Tham số k1BM25 saturation parameter k1C7 · Truy hồi
Núm chỉnh mức bão hoà tần suất của BM25. Càng nhỏ thì lần xuất hiện thứ mười càng gần vô nghĩa, và k1 bằng 0 biến BM25 thành phép đếm có hay không.
Mở bài dạy thuật ngữ này - Thang Landis và KochLandis and Koch scaleC8 · Cạm bẫy
Sáu mức diễn giải quen thuộc cho kappa, từ rất kém tới gần như hoàn hảo. Chính hai tác giả viết rằng các mốc này do họ chia một cách tuỳ ý.
Mở bài dạy thuật ngữ này - Thông tin tương hỗ theo điểmPointwise mutual information (PMI)C3 · Ngữ cảnh
Log của tỉ số giữa xác suất hai từ đi cùng nhau và xác suất chúng gặp nhau do tình cờ. Dương nghĩa là gắn bó hơn mức ngẫu nhiên.
Mở bài dạy thuật ngữ này - Thứ hạng nghịch đảo trung bìnhMean reciprocal rank (MRR)C7 · Truy hồi
Trung bình của 1 chia cho thứ hạng kết quả đúng đầu tiên. Chỉ nhìn một kết quả đúng, những cái sau không tính.
Mở bài dạy thuật ngữ này - Tỉ lệ lỗi ký tựCharacter error rate (CER)C6 · Văn bản sinh ra
Như WER nhưng đếm theo ký tự. Thường thấp hơn WER nhiều vì sai một dấu chỉ hỏng một ký tự chứ không hỏng cả từ.
Mở bài dạy thuật ngữ này - Tỉ lệ lỗi từWord error rate (WER)C6 · Văn bản sinh ra
Khoảng cách chỉnh sửa theo từ chia cho số từ của câu tham chiếu. Không có trần, nên vượt 100% là chuyện bình thường.
Mở bài dạy thuật ngữ này - Tỉ lệ OOVOOV rateC1 · Token
Phần văn bản rơi ra ngoài từ vựng. Tính theo token và tính theo type cho hai con số rất khác nhau, phải nói rõ đang dùng con số nào.
Mở bài dạy thuật ngữ này - TokenTokenC1 · Token
Đơn vị nhỏ nhất mà mô hình nhìn thấy sau khi cắt văn bản. Có thể là một ký tự, một từ hoặc một mảnh từ, tuỳ cách tách.
Mở bài dạy thuật ngữ này - Tổng lềMarginal totalsC8 · Cạm bẫy
Số lần mỗi người chấm dùng mỗi nhãn, tức tổng theo hàng và theo cột của bảng chéo. Chúng quyết định Pe và quyết định luôn trần của kappa.
Mở bài dạy thuật ngữ này - Trần của kappaMaximum attainable kappaC8 · Cạm bẫy
Giá trị kappa lớn nhất còn đạt được khi giữ nguyên hai tổng lề. Vì trần phụ thuộc phân bố nhãn nên kappa của hai bộ dữ liệu khác nhau không so được.
Mở bài dạy thuật ngữ này - Truy hồi thông tinInformation retrievalC7 · Truy hồi
Bài toán xếp hạng tài liệu theo mức liên quan với một truy vấn. Các độ đo của nó đọc theo thứ hạng chứ không theo nhãn đúng sai.
Mở bài dạy thuật ngữ này - Từ đa nghĩaPolysemyC3 · Ngữ cảnh
Một chuỗi ký tự mang nhiều nghĩa khác nhau. Một vector duy nhất cho cả từ sẽ trộn lẫn các nghĩa đó lại.
Mở bài dạy thuật ngữ này - Từ ngoài từ vựngOut-of-vocabulary (OOV)C1 · Token
Từ xuất hiện trong văn bản nhưng không có trong từ vựng. Mô hình mất thông tin ở đúng chỗ đó, thường thay bằng một token lạ duy nhất.
Mở bài dạy thuật ngữ này - Từ vựngVocabularyC1 · Token
Danh sách hữu hạn các token mà mô hình biết. Mọi thứ không nằm trong danh sách này đều phải bị thay thế hoặc bị vỡ nhỏ ra.
Mở bài dạy thuật ngữ này - Túi từBag of wordsC2 · Biểu diễn
Cách biểu diễn tài liệu bằng số lần xuất hiện của từng từ, bỏ hoàn toàn thứ tự. Đơn giản, và đó vừa là điểm mạnh vừa là điểm yếu.
Mở bài dạy thuật ngữ này - Vector ngữ cảnhContext vectorC3 · Ngữ cảnh
Vector mô tả một lần xuất hiện của từ bằng chính các từ hàng xóm của nó trong câu đó.
Mở bài dạy thuật ngữ này - Vector nhúngWord embeddingC3 · Ngữ cảnh
Vector số chiều thấp gán cho một từ, học từ ngữ liệu, sao cho từ gần nghĩa thì gần nhau theo cosine.
Mở bài dạy thuật ngữ này - Weighted F1Weighted F1C5 · Phân loại
Trung bình F1 của các lớp, có trọng số theo số mẫu của mỗi lớp. Nằm giữa micro và macro, và giấu lớp hiếm gần như macro không giấu.
Mở bài dạy thuật ngữ này - Xác suất bằng khôngZero probabilityC4 · Mô hình ngôn ngữ
Một cụm chưa từng xuất hiện trong ngữ liệu nhận xác suất 0, và vì cả câu là một tích nên một số 0 giết luôn cả câu.
Mở bài dạy thuật ngữ này - Xác suất hậu nghiệmPosterior probabilityC5 · Phân loại
Xác suất của lớp sau khi đã nhìn văn bản. Đây là con số cuối cùng dùng để quyết định nhãn.
Mở bài dạy thuật ngữ này - Xác suất tiên nghiệmPrior probabilityC5 · Phân loại
Xác suất của một lớp trước khi nhìn vào văn bản, thường lấy bằng tỉ lệ lớp đó trong tập huấn luyện.
Mở bài dạy thuật ngữ này - Xử lý ngôn ngữ tự nhiênNatural language processing (NLP)Nhập môn
Ngành làm cho máy đọc, đo và sinh được ngôn ngữ của người. Trong sách này nó hiện ra dưới dạng các bước đếm, các vector và các độ đo.
Mở bài dạy thuật ngữ này
Bảng này chứa gì và không chứa gì
Đây là vốn từ của riêng môn này, không phải từ điển của cả ngành NLP. Mỗi mục có mặt ở đây vì nó xuất hiện trong một bài của sách, và cả 145 mục đều dẫn tới một trong 26 bài đó. Ngược lại, một thuật ngữ NLP hoàn toàn chính thống mà sách chưa dạy thì sẽ không tìm thấy ở đây, và đó là chủ ý chứ không phải thiếu sót: một bảng tra dẫn tới bài dạy chỉ có nghĩa khi bài dạy có thật.
Cổng kiểm của trang khoá cả hai chiều. Chiều thứ nhất, từng đường dẫn phải ứng với một file .mdx có thật trên đĩa, vì một bảng tra dẫn tới trang lỗi còn tệ hơn là không có bảng tra. Chiều thứ hai, mỗi bài trong sách phải được ít nhất một thuật ngữ trỏ tới, để bảng không lặng lẽ cũ đi khi sách dài thêm. Bản đầu của trang này để trống sáu mục thuộc nhóm truy hồi vì lúc đó chương ấy chưa dựng xong; nay chương đã có bài nên cả sáu mục đã được nối, và hiện không còn mục nào ghi Chưa có bài riêng trong sách.
Phân bố theo chương, đúng như bộ lọc Chương in ra trong ngoặc: Nhập môn 2 mục, chương 1 Token 13, chương 2 Biểu diễn 13, chương 3 Ngữ cảnh 11, chương 4 Mô hình ngôn ngữ 18, chương 5 Phân loại 21, chương 6 Văn bản sinh ra 16, chương 7 Truy hồi 25, chương 8 Cạm bẫy 26.
Đừng đọc trang này theo thứ tự. Khi gặp một từ lạ, gõ ba bốn chữ đầu của nó vào ô tìm kiếm, đọc đúng một câu định nghĩa, rồi bấm vào bài dạy nếu vẫn thấy mờ. Nếu bạn đang ôn cả một chương, đổi sang sắp xếp Theo chương và lọc đúng chương đó để thấy toàn bộ vốn từ của chương gom lại một chỗ.