Chuyển tới nội dung chính

Bảng tra thuật ngữ

94 thuật ngữ24 bàiTìm không dấu

Bảng tra thuật ngữ

Bạn đang đọc báo cáo kỹ thuật của một mô hình mở và vấp phải một chữ viết tắt. Trang này để tra trong mười giây rồi quay lại chỗ đang đọc, chứ không phải để đọc từ đầu tới cuối.

Mỗi mục ở đây gồm bốn thứ: tên tiếng Việt, tên tiếng Anh đúng như nó xuất hiện trong báo cáo kỹ thuật, một câu định nghĩa, và đường dẫn tới bài dạy kỹ thuật ngữ đó. Định nghĩa cố ý ngắn. Nếu một câu chưa đủ thì bạn cần bài dạy chứ không cần một câu dài hơn, và nút liên kết nằm ngay dưới mỗi thẻ.

Ô tìm kiếm quét đồng thời tên tiếng Việt, tên tiếng Anh và cả nội dung định nghĩa. Nhờ vậy gõ rope_theta ra được mục Cơ số RoPE dù chữ đó chỉ nằm trong phần định nghĩa, và gõ adam ra Trạng thái bộ tối ưu. Bộ lọc chương thu hẹp về đúng một chương, hai nút sắp xếp đổi giữa thứ tự chữ cái và thứ tự chương, núm Bỏ dấu quyết định hai phía có được gỡ dấu trước khi so hay không, còn nút Xoá bộ lọc trả cả bốn thứ đó về mặc định cùng lúc. Con số bên phải thanh công cụ luôn là số thẻ thật đang hiển thị: bảng không có phân trang nên không có chuyện danh sách bị cắt bớt phía sau.

Bảng tra thuật ngữ · gõ một từ, lọc theo chương
Hiện 94 / 94 thuật ngữ
  • Alpha của LoRALoRA alphaC6 · Huấn luyện

    Tử số của hệ số nhân alpha chia r đứng trước bản cập nhật. Nó không tạo thêm một trọng số huấn luyện được nào.

    Mở bài dạy thuật ngữ này
  • Bản gốc để soBaseline for comparisonC8 · Tra cứu

    Cấu hình không dùng kỹ thuật nào: mô hình dày, chú ý nhiều đầu, mặt nạ nhân quả đầy đủ. Mọi phần trăm tiết kiệm đều chia cho nó.

    Mở bài dạy thuật ngữ này
  • Bản trọng số chủFP32 master weightsC6 · Huấn luyện

    Bản 4 byte riêng của trọng số mà bước cập nhật làm việc trên đó. Đây là khoản hay bị quên nhất khi cộng hoá đơn huấn luyện.

    Mở bài dạy thuật ngữ này
  • BF16BF16 bfloat16C5 · Ít bit

    Định dạng 16 bit theo bố cục 1 cộng 8 cộng 7. Cùng dải với FP32 nên không tràn, đổi lại kém chính xác hơn FP16 ở gần số 1.

    Mở bài dạy thuật ngữ này
  • Bias chỉ để xếp hạngAuxiliary-loss-free routing biasC2 · Chuyên gia

    Cách chữa mất cân bằng bằng một số bias chỉ cộng vào điểm dùng để xếp hạng, không đụng gradient và không đổi trọng số trộn.

    Mở bài dạy thuật ngữ này
  • Biên phần thưởngReward marginC6 · Huấn luyện

    Hiệu hai phần thưởng hàm ý của câu được chọn và câu bị loại. Biên bằng 0 thì mất mát đúng bằng log 2 dù beta là bao nhiêu.

    Mở bài dạy thuật ngữ này
  • Bộ đệm KVKV cacheC1 · Chú ý

    Vùng nhớ giữ vector khoá và giá trị của mọi token đã đi qua, để mỗi bước sinh mới không phải tính lại từ đầu chuỗi.

    Mở bài dạy thuật ngữ này
  • Bộ đệm KV phân trangPaged KV cacheC4 · Sinh nhanh

    Chia bể nhớ thành trang cỡ cố định và cho mỗi yêu cầu giữ một bảng ánh xạ trang, thay vì một khối liền mạch đặt trước.

    Mở bài dạy thuật ngữ này
  • Buộc chung trọng số nhúngTied word embeddingsC7 · Đọc mô hình

    Công tắc cho đầu ra ngôn ngữ dùng lại đúng bảng nhúng token. Bật nó là bớt đúng từ vựng nhân chiều ẩn tham số.

    Mở bài dạy thuật ngữ này
  • Bước sóng của dảiWavelength of a frequency bandC3 · Vị trí

    Số token phải đi qua để một cặp chiều quay trọn một vòng. Cặp đầu quay nhanh, cặp cuối gần như đứng yên.

    Mở bài dạy thuật ngữ này
  • Byte mỗi tokenBytes per cached tokenC1 · Chú ý

    Giá bộ đệm của một token, bằng 2 nhân số lớp nhân số đầu KV nhân chiều mỗi đầu nhân số byte mỗi phần tử.

    Mở bài dạy thuật ngữ này
  • Byte tiết kiệm đượcBytes savedC8 · Tra cứu

    Chênh lệch giữa bản gốc và bản đã áp đúng một kỹ thuật. Phần tiết kiệm của nhiều kỹ thuật không cộng dồn được, vì chúng cùng nhân vào một con số.

    Mở bài dạy thuật ngữ này
  • Byte trọng số phải nạpWeight bytes to loadC8 · Tra cứu

    Số byte phải nằm sẵn trong bộ nhớ để chạy mô hình. Trộn chuyên gia cắt phép tính rất nhiều nhưng cắt đúng 0 byte của khoản này.

    Mở bài dạy thuật ngữ này
  • Cặp chiềuDimension pairC3 · Vị trí

    Hai toạ độ liền nhau của một đầu, được RoPE coi như một điểm trên mặt phẳng và quay cùng một góc.

    Mở bài dạy thuật ngữ này
  • Cặp chú ýAttention pairsC8 · Tra cứu

    Số cặp truy vấn và khoá phải tính khi nạp cả ngữ cảnh, cộng trên mọi lớp và mọi đầu. Bậc hai theo độ dài, trừ khi có cửa sổ trượt.

    Mở bài dạy thuật ngữ này
  • Chia mảnh tệpModel file shardingC7 · Đọc mô hình

    Cắt bộ trọng số thành nhiều tệp theo một trần kích thước. Số mảnh thật luôn lớn hơn hoặc bằng phép chia làm tròn lên.

    Mở bài dạy thuật ngữ này
  • Chia mô hình cho nhiều thiết bịMulti-device model splitC7 · Đọc mô hình

    Hạ hoá đơn mỗi thẻ bằng cách trải mô hình ra nhiều thiết bị. Mỗi cách chia mang phí liên lạc và phần dôi riêng của nó.

    Mở bài dạy thuật ngữ này
  • Chia sẻ trangPage sharingC4 · Sinh nhanh

    Nhiều yêu cầu cùng mở đầu bằng một đoạn giống hệt nhau thì trỏ chung vào cùng các trang, thay vì mỗi yêu cầu giữ một bản riêng.

    Mở bài dạy thuật ngữ này
  • Chia trạng thái theo bậcZeRO sharding stagesC6 · Huấn luyện

    Chia trạng thái bộ tối ưu, rồi gradient, rồi cả trọng số cho nhiều thiết bị. Nó không chạm được vào phần kích hoạt.

    Mở bài dạy thuật ngữ này
  • Chiều ẩnHidden sizeC7 · Đọc mô hình

    Bề rộng vector đi xuyên qua mọi lớp. Gần như mọi ma trận của mô hình đều có ít nhất một cạnh bằng con số này.

    Mở bài dạy thuật ngữ này
  • Chiều tiềm ẩnLatent dimensionC1 · Chú ý

    Bề rộng của vector tiềm ẩn, ký hiệu d_c. Nó nằm dưới mẫu của hệ số nén, nên hạ nó xuống là nén mạnh thêm.

    Mở bài dạy thuật ngữ này
  • Chiều trung gianIntermediate sizeC7 · Đọc mô hình

    Bề rộng bên trong khối tiến. Nó lớn hơn chiều ẩn vài lần, và đó là lý do khối tiến nặng hơn hẳn khối chú ý.

    Mở bài dạy thuật ngữ này
  • Chú ý một cặp KVMulti-query attention (MQA)C1 · Chú ý

    Mọi đầu truy vấn dùng chung đúng một cặp khoá và giá trị. Bộ đệm nhỏ nhất có thể, đổi lại chất lượng giảm rõ rệt.

    Mở bài dạy thuật ngữ này
  • Chú ý nhiều đầuMulti-head attention (MHA)C1 · Chú ý

    Cách chú ý nguyên bản, mỗi đầu truy vấn mang một cặp khoá và giá trị riêng. Nó là một đầu của thang chia sẻ, không phải một cơ chế đứng riêng.

    Mở bài dạy thuật ngữ này
  • Chú ý theo nhómGrouped-query attention (GQA)C1 · Chú ý

    Chia các đầu truy vấn thành nhóm, mỗi nhóm dùng chung một cặp khoá và giá trị. Số nhóm buộc phải là ước của số đầu truy vấn.

    Mở bài dạy thuật ngữ này
  • Chú ý tiềm ẩn đa đầuMulti-head latent attention (MLA)C1 · Chú ý

    Cách nén bộ đệm bằng cách chiếu khoá và giá trị xuống một vector tiềm ẩn chiều thấp, rồi chiếu lên lại đúng lúc tính.

    Mở bài dạy thuật ngữ này
  • Chuyên gia chia sẻShared expertC2 · Chuyên gia

    Chuyên gia luôn chạy cho mọi token và không đi qua bộ định tuyến, để phần kiến thức chung khỏi phải học lại ở từng chuyên gia.

    Mở bài dạy thuật ngữ này
  • Chuyên gia hạt mịnFine-grained expertsC2 · Chuyên gia

    Chẻ mỗi chuyên gia thành m phần hẹp hơn rồi chọn nhiều hơn m lần, giữ nguyên ngân sách tính mà mở rộng không gian tổ hợp.

    Mở bài dạy thuật ngữ này
  • Cỡ nhómGroup sizeC5 · Ít bit

    Số trọng số dùng chung một hệ số tỉ lệ. Nhóm nhỏ thì chính xác hơn nhưng khoản phụ thu 16 chia cỡ nhóm bit lớn lên.

    Mở bài dạy thuật ngữ này
  • Cơ số RoPERoPE baseC3 · Vị trí

    Hằng số quyết định tốc độ quay giảm dần theo chỉ số cặp chiều, thường ghi trong config.json dưới tên rope_theta.

    Mở bài dạy thuật ngữ này
  • Công thức 6NDThe 6ND ruleC6 · Huấn luyện

    Ước lượng ngân sách huấn luyện bằng 6 nhân số tham số nhân số token, trong đó 2 phần cho lượt xuôi và 4 phần cho lượt ngược.

    Mở bài dạy thuật ngữ này
  • Cửa sổ trượtSliding window attentionC1 · Chú ý

    Mỗi token chỉ được nhìn W token gần nhất, nhờ đó bộ đệm thôi lớn lên theo ngữ cảnh và đứng lại ở một trần cố định.

    Mở bài dạy thuật ngữ này
  • Đầu dự đoán phụAuxiliary prediction headC4 · Sinh nhanh

    Khối nhỏ gắn thêm vào thân mô hình để đoán một vị trí xa hơn. Mỗi đầu tốn tham số và tốn thêm một phần lượt tính.

    Mở bài dạy thuật ngữ này
  • Điểm cắt ngữ cảnhCache versus weights crossoverC1 · Chú ý

    Độ dài ngữ cảnh mà tại đó bộ đệm KV nặng bằng đúng bộ trọng số. Vượt qua nó thì phần lớn bộ nhớ là bộ đệm chứ không phải mô hình.

    Mở bài dạy thuật ngữ này
  • Định tuyến giới hạn theo nhómGroup-limited routingC2 · Chuyên gia

    Buộc mỗi token chỉ chọn chuyên gia nằm trong một số nhóm máy nhất định, để giảm lưu lượng mạng giữa các máy.

    Mở bài dạy thuật ngữ này
  • Định tuyến top-kTop-k routingC2 · Chuyên gia

    Bộ định tuyến chấm điểm mọi chuyên gia cho một token rồi chỉ gửi token đó tới k chuyên gia có điểm cao nhất.

    Mở bài dạy thuật ngữ này
  • Độ chính xác trộnMixed precision trainingC6 · Huấn luyện

    Lượt xuôi và lượt ngược chạy trên bản 2 byte cho nhanh, còn bước cập nhật làm trên bản 4 byte để cộng dồn lượng nhỏ không bị mất.

    Mở bài dạy thuật ngữ này
  • Độ dài đoán trướcSpeculation lengthC4 · Sinh nhanh

    Số token mà mô hình nháp chạy trước mỗi vòng, ký hiệu gamma. Đoán càng xa càng tốt là trực giác sai, vì đường lợi ích có đỉnh.

    Mở bài dạy thuật ngữ này
  • Đổi cơ số kiểu NTKNTK-aware base scalingC3 · Vị trí

    Nâng cơ số RoPE lên thay vì nén vị trí, nhờ đó dải nhanh nhất giữ nguyên bước góc còn dải chậm bị nén nhiều hơn.

    Mở bài dạy thuật ngữ này
  • Dự đoán nhiều tokenMulti-token prediction (MTP)C4 · Sinh nhanh

    Gắn thêm vài đầu ra phụ, đầu thứ k dự đoán token cách đó k bước, để có sẵn bản nháp mà không cần một mô hình thứ hai.

    Mở bài dạy thuật ngữ này
  • FP16FP16 half precisionC5 · Ít bit

    Định dạng 16 bit theo bố cục 1 cộng 5 cộng 10. Dải chỉ tới 65.504 nên rất dễ tràn thành vô cực khi huấn luyện.

    Mở bài dạy thuật ngữ này
  • FP8FP8C5 · Ít bit

    Định dạng 8 bit với hai biến thể E4M3 và E5M2 chia bit khác nhau, nên một biến thể rộng dải còn biến thể kia chính xác hơn.

    Mở bài dạy thuật ngữ này
  • Giải mã đầu cơSpeculative decodingC4 · Sinh nhanh

    Một mô hình nhỏ đoán trước vài token, mô hình lớn chấm cả loạt trong một lượt rồi giữ lại đúng phần tiền tố đoán trúng.

    Mở bài dạy thuật ngữ này
  • Hàm mất mát cân bằng tảiAuxiliary load-balancing lossC2 · Chuyên gia

    Số hạng thêm vào hàm mất mát để ép tỉ lệ token chia đều hơn. Nó can thiệp thẳng vào gradient của mô hình.

    Mở bài dạy thuật ngữ này
  • Hạng của bộ chuyểnAdapter rankC6 · Huấn luyện

    Bề rộng chung của hai ma trận gầy, ký hiệu r. Tăng r là tăng thẳng số tham số huấn luyện được theo đúng tỉ lệ.

    Mở bài dạy thuật ngữ này
  • Hệ số tỉ lệQuantization scaleC5 · Ít bit

    Số nhân đưa mã nguyên về lại giá trị thực. Mỗi nhóm phải lưu một cái, và đó là khoản mà mọi ước lượng gọn đều quên.

    Mở bài dạy thuật ngữ này
  • INT4INT4C5 · Ít bit

    Mã nguyên 4 bit, chạy từ âm 7 tới 7 ở chế độ đối xứng. Bốn bit là chặn dưới, vì còn phải cộng phần lưu hệ số tỉ lệ.

    Mở bài dạy thuật ngữ này
  • Khoá và giá trịKeys and valuesC1 · Chú ý

    Hai vector mà mỗi token để lại cho các bước sau đọc. Vì có đúng hai nên mọi công thức byte bộ đệm đều mở đầu bằng số 2.

    Mở bài dạy thuật ngữ này
  • Khối tiến SwiGLUSwiGLU feed-forward blockC7 · Đọc mô hình

    Khối tiến có cổng, gồm ba ma trận chứ không phải hai: cổng, nhánh lên và nhánh xuống. Đếm hai là thiếu ngay một phần ba.

    Mở bài dạy thuật ngữ này
  • Không gian tổ hợp chuyên giaExpert combination spaceC2 · Chuyên gia

    Số cách chọn k chuyên gia trong n cái, tức tổ hợp chập k của n. Chia nhỏ chuyên gia làm con số này lớn lên rất nhanh.

    Mở bài dạy thuật ngữ này
  • Làm tròn tới số chẵnRound half to evenC5 · Ít bit

    Quy tắc mặc định khi giá trị rơi đúng chính giữa hai mức biểu diễn được: chọn mức có bit cuối bằng 0, không phải luôn làm tròn lên.

    Mở bài dạy thuật ngữ này
  • Lượng tử hoá theo nhómGroup-wise quantizationC5 · Ít bit

    Chia trọng số thành các nhóm liền nhau, mỗi nhóm tự tính hệ số tỉ lệ riêng, nên một giá trị lớn ở nơi khác không làm thô cả tầng.

    Mở bài dạy thuật ngữ này
  • Mã hoá vị trí quayRotary position embedding (RoPE)C3 · Vị trí

    Cách gắn vị trí bằng cách quay từng cặp toạ độ của truy vấn và khoá đi một góc tỉ lệ với vị trí của token.

    Mở bài dạy thuật ngữ này
  • Ma trận cổngRouter gate matrixC2 · Chuyên gia

    Ma trận nhỏ chấm điểm token với từng chuyên gia. Nó phình theo số chuyên gia nhưng vẫn nhẹ hơn hẳn so với chính các chuyên gia.

    Mở bài dạy thuật ngữ này
  • Mất cân bằng tảiExpert load imbalanceC2 · Chuyên gia

    Tình trạng vài chuyên gia hút phần lớn token còn số còn lại gần như bị bỏ đói, làm phần tham số kia thành vô dụng.

    Mở bài dạy thuật ngữ này
  • MFUModel FLOPs utilization (MFU)C6 · Huấn luyện

    Phần sức tính đỉnh của thiết bị thật sự dùng được cho phép tính của mô hình. Nó là hệ số biến số phép tính thành giờ máy.

    Mở bài dạy thuật ngữ này
  • Mô hình đíchTarget modelC4 · Sinh nhanh

    Mô hình lớn mà kết quả cuối cùng phải theo. Nó chấm điểm cả loạt token nháp trong đúng một lượt chạy.

    Mở bài dạy thuật ngữ này
  • Mô hình ngôn ngữ lớnLarge language model (LLM)Nhập môn

    Mạng dự đoán token kế tiếp, lớn tới mức phần lớn quyết định kiến trúc của nó trở thành bài toán kế toán byte và tham số.

    Mở bài dạy thuật ngữ này
  • Mô hình nhápDraft modelC4 · Sinh nhanh

    Mô hình nhỏ và nhanh sinh ra các token đoán trước. Nó vẫn tốn tiền dù phần đoán của nó có bị từ chối hay không.

    Mở bài dạy thuật ngữ này
  • Ngân sách tính toánTraining compute budgetC6 · Huấn luyện

    Tổng số phép tính dấu phẩy động của một lần huấn luyện. Nhân với MFU và giá thuê máy là ra số giờ GPU và ra tiền.

    Mở bài dạy thuật ngữ này
  • Ngữ cảnh dài nhất còn nhét đượcMaximum fitting contextC7 · Đọc mô hình

    Số token lớn nhất mà bộ đệm còn vừa sau khi đã trừ trọng số và phần dôi. Con số này có ích hơn hẳn câu vừa hay không vừa.

    Mở bài dạy thuật ngữ này
  • Nới ngữ cảnhContext length extensionC3 · Vị trí

    Cho một mô hình đã huấn luyện xong làm việc với chuỗi dài hơn cửa sổ nó từng thấy, bằng cách chia tốc độ quay của từng dải tần.

    Mở bài dạy thuật ngữ này
  • Nội suy vị tríPosition interpolationC3 · Vị trí

    Chia mọi vị trí cho hệ số nới trước khi quay. Không dải nào ra ngoài vùng đã học, đổi lại thước đo mịn nhất bị làm thô đi.

    Mở bài dạy thuật ngữ này
  • Nút thắtBottleneckC8 · Tra cứu

    Đại lượng đang thiếu ở cấu hình của bạn: bộ nhớ khi nạp mô hình, bộ nhớ khi ngữ cảnh dài, tốc độ sinh từng token hay thông lượng theo lô.

    Mở bài dạy thuật ngữ này
  • Phần định trịMantissaC5 · Ít bit

    Nhóm bit quyết định trong một khoảng độ lớn thì số được ghi chi tiết tới đâu. Bit 1 đứng trước dấu phẩy không được lưu.

    Mở bài dạy thuật ngữ này
  • Phần dôi khi chạyRuntime overheadC7 · Đọc mô hình

    Vùng làm việc tạm, phân mảnh bộ cấp phát và ngữ cảnh thiết bị. Không phép nhân nào đoán được nó, nên nó phải là một hệ số bạn đặt.

    Mở bài dạy thuật ngữ này
  • Phần mang vị trí tách riêngDecoupled RoPE componentC1 · Chú ý

    Phần chiều mang thông tin vị trí được để riêng và không nén cùng vector tiềm ẩn, vì phép quay không đi qua được phép chiếu.

    Mở bài dạy thuật ngữ này
  • Phân mảnh trongInternal fragmentationC4 · Sinh nhanh

    Bộ nhớ bỏ không nằm bên trong vùng đã cấp cho một yêu cầu. Bộ cấp phát không lấy lại được nó cho ai khác.

    Mở bài dạy thuật ngữ này
  • Phần thưởng hàm ýImplicit rewardC6 · Huấn luyện

    Beta nhân tỉ số log giữa chính sách và mô hình tham chiếu. Nó đo độ dịch chuyển so với tham chiếu chứ không đo xác suất tuyệt đối.

    Mở bài dạy thuật ngữ này
  • Phép nhân cộng dồnMultiply-accumulate (MAC)C8 · Tra cứu

    Đơn vị đếm phép tính, quy ước bằng hai phép tính dấu phẩy động. Đổi quy ước là mọi con số FLOPs lệch đúng hai lần, nên phải ghi rõ.

    Mở bài dạy thuật ngữ này
  • QLoRAQLoRAC6 · Huấn luyện

    Đóng băng mô hình gốc ở 4 bit rồi vẫn học bộ chuyển hạng thấp bên trên, để cắt luôn khoản trọng số mà LoRA không cắt được.

    Mở bài dạy thuật ngữ này
  • safetensorssafetensorsC7 · Đọc mô hình

    Định dạng lưu trọng số gồm một phần đầu mô tả tên và hình dáng từng tensor, rồi tới khối dữ liệu thô nằm ngay sau.

    Mở bài dạy thuật ngữ này
  • Số mũExponentC5 · Ít bit

    Nhóm bit quyết định độ lớn của một số thực, tức đẩy dấu phẩy đi bao xa. Nhiều bit mũ thì dải giá trị rộng ra.

    Mở bài dạy thuật ngữ này
  • Số nhóm KVNumber of KV groupsC1 · Chú ý

    Núm quyết định hệ số tiết kiệm bộ đệm, vì hệ số đó đúng bằng số đầu truy vấn chia số nhóm KV, không có phép nhân nào khác.

    Mở bài dạy thuật ngữ này
  • Suy luậnInferenceNhập môn

    Giai đoạn chạy một mô hình đã huấn luyện xong để sinh chữ. Hoá đơn bộ nhớ của nó khác hẳn hoá đơn lúc huấn luyện.

    Mở bài dạy thuật ngữ này
  • Tái tính kích hoạtActivation recomputationC6 · Huấn luyện

    Mỗi lớp chỉ giữ đầu vào của nó rồi tính lại phần bên trong lúc truyền ngược. Cắt mạnh phần kích hoạt, đổi lại thêm một lượt tính.

    Mở bài dạy thuật ngữ này
  • Tầm nhìn qua các lớpReceptive field across layersC1 · Chú ý

    Khoảng cách xa nhất mà thông tin còn truyền tới được sau khi chồng nhiều lớp cửa sổ trượt, xấp xỉ số lớp nhân bề rộng cửa sổ.

    Mở bài dạy thuật ngữ này
  • Tệp cấu hình mô hìnhconfig.jsonC7 · Đọc mô hình

    Tệp khai kiến trúc của một mô hình mở. Từ vài trường trong đó cộng ra được số tham số khớp với con số nhà sản xuất công bố.

    Mở bài dạy thuật ngữ này
  • Tham số hoạt độngActive parametersC2 · Chuyên gia

    Phần trọng số thật sự tham gia tính cho mỗi token. Nó quyết định phép tính, còn tham số tổng quyết định bộ nhớ.

    Mở bài dạy thuật ngữ này
  • Tham số tổngTotal parametersC2 · Chuyên gia

    Toàn bộ trọng số phải nạp vào bộ nhớ, kể cả những chuyên gia mà một token cụ thể không hề chạy qua.

    Mở bài dạy thuật ngữ này
  • Tỉ lệ chấp nhậnAcceptance rateC4 · Sinh nhanh

    Xác suất một token nháp được mô hình đích nhận. Đây là biến quyết định giải mã đầu cơ có lãi hay lỗ.

    Mở bài dạy thuật ngữ này
  • Tỉ lệ ChinchillaChinchilla ratioC6 · Huấn luyện

    Kết luận rằng với một ngân sách cho trước thì nên học khoảng 20 token cho mỗi tham số. Các mô hình gần đây vượt xa mốc đó.

    Mở bài dạy thuật ngữ này
  • Tinh chỉnh hạng thấpLow-rank adaptation (LoRA)C6 · Huấn luyện

    Đóng băng trọng số gốc và chỉ học hai ma trận gầy, nên số tham số huấn luyện được đi từ tích hai chiều xuống tổng hai chiều nhân hạng.

    Mở bài dạy thuật ngữ này
  • Tối ưu theo sở thích trực tiếpDirect preference optimization (DPO)C6 · Huấn luyện

    Học từ các cặp câu đã được người xếp hạng, bằng một hàm mất mát viết thẳng trên chính sách, không cần dựng riêng mô hình phần thưởng.

    Mở bài dạy thuật ngữ này
  • Token neoAttention sinkC1 · Chú ý

    Vài token đầu chuỗi được giữ lại vĩnh viễn ngoài cửa sổ. Rẻ tới mức gần như không thấy trên hoá đơn byte.

    Mở bài dạy thuật ngữ này
  • Trần kích thước mảnhShard size capC7 · Đọc mô hình

    Số byte tối đa của một tệp mảnh. Trần 5 GB nghĩa là 5 nhân 10 luỹ thừa 9 byte, không phải 5 lần 2 luỹ thừa 30.

    Mở bài dạy thuật ngữ này
  • Trạng thái bộ tối ưuOptimizer statesC6 · Huấn luyện

    Các moment mà bộ tối ưu giữ riêng cho từng tham số. Với Adam là hai cái, và chúng chiếm phần lớn hoá đơn trạng thái.

    Mở bài dạy thuật ngữ này
  • TransformerTransformerNhập môn

    Bộ xương kiến trúc công bố năm 2017, tới nay vẫn giữ nguyên trong mọi mô hình mở, chỉ đổi ở từng bộ phận bên trong.

    Mở bài dạy thuật ngữ này
  • Trộn chuyên giaMixture of experts (MoE)C2 · Chuyên gia

    Kiến trúc thay một khối tiến dày bằng rất nhiều khối hẹp, và mỗi token chỉ chạy qua vài khối trong số đó.

    Mở bài dạy thuật ngữ này
  • Trọng số ngoại lệOutlier weightC5 · Ít bit

    Một giá trị lớn bất thường kéo hệ số tỉ lệ của cả nhóm lên, làm mọi trọng số còn lại trong nhóm bị lượng tử thô hẳn đi.

    Mở bài dạy thuật ngữ này
  • Vector tiềm ẩnLatent vectorC1 · Chú ý

    Thứ duy nhất còn phải nhớ cho mỗi token trong MLA, đứng thay cho cả khoá lẫn giá trị của toàn bộ các đầu.

    Mở bài dạy thuật ngữ này
  • Vị trí tương đốiRelative positionC3 · Vị trí

    Hiệu giữa hai vị trí trong chuỗi. Điểm chú ý của RoPE chỉ phụ thuộc hiệu này chứ không phụ thuộc hai vị trí tuyệt đối.

    Mở bài dạy thuật ngữ này
  • Xác suất chấp nhận tích luỹCumulative acceptance probabilityC4 · Sinh nhanh

    Token nháp thứ ba chỉ được giữ nếu hai token trước đều đúng, nên phải nhân dồn chứ không được cộng thẳng các độ chính xác.

    Mở bài dạy thuật ngữ này
  • YaRN theo dải tầnYaRN band-wise interpolationC3 · Vị trí

    Quyết định theo từng dải dựa trên số vòng quay trong cửa sổ huấn luyện: dải quay ít thì giữ nguyên, dải quay nhiều thì nội suy hết.

    Mở bài dạy thuật ngữ này

Bảng này chứa gì và không chứa gì

Đây là vốn từ của riêng học phần này, không phải từ điển của cả ngành. Mỗi mục có mặt ở đây vì nó xuất hiện trong một bài của sách, và cả 94 mục đều dẫn tới một trong 23 bài đó. Ngược lại, một thuật ngữ LLM hoàn toàn chính thống mà sách chưa dạy thì sẽ không tìm thấy ở đây, và đó là chủ ý chứ không phải thiếu sót: một bảng tra dẫn tới bài dạy chỉ có nghĩa khi bài dạy có thật.

Bảng cũng không phải một bảng chọn kỹ thuật. Nó nói MQA là gì, không nói bạn nên dùng MQA hay GQA. Câu hỏi nên dùng cái nào phụ thuộc chất lượng sau khi huấn luyện, mà chất lượng thì không bài nào trong sách này đo được, nên bảng tra cũng không được phép ám chỉ.

Cổng kiểm của trang khoá cả hai chiều. Chiều thứ nhất, từng đường dẫn phải ứng với một tệp .mdx có thật trên đĩa, kiểm bằng cách đọc thẳng thư mục chứ không tin dữ liệu, vì một bảng tra dẫn tới trang lỗi còn tệ hơn là không có bảng tra. Chiều thứ hai, mỗi bài trong sách phải được ít nhất một thuật ngữ trỏ tới, để bảng không lặng lẽ cũ đi khi sách dài thêm. Học phần có 24 bài, và 23 bài được phủ: bài mỏng nhất được 3 thuật ngữ trỏ tới, bài dày nhất được 6, không bài nào bị bỏ sót.

Bài thứ 24 là chính trang này, và nó được miễn trừ có ghi tên. Một thuật ngữ trỏ về đúng cái bảng thuật ngữ bạn đang mở là một liên kết vòng tròn, không dạy được gì. Nhưng miễn trừ lại là chỗ rất dễ biến thành ngăn kéo giấu bài chưa phủ, nên cổng khoá nó bằng bốn khẳng định: danh sách miễn trừ phải có đúng một mục, mục đó phải là một tệp có thật trên đĩa, mục đó phải nằm trong danh sách bài vừa quét, và bỏ miễn trừ đi thì phải lộ ra đúng một bài chưa phủ chứ không phải hai. Bài còn lại của chương 8, tức trang chọn kỹ thuật, không được miễn trừ và có 6 thuật ngữ trỏ tới như mọi bài khác.

Cổng còn đọc luôn sidebars.ts và bắt tám nhãn chương trong dữ liệu khớp từng chữ với tám chương thật của sách.

Phân bố theo chương, đúng như bộ lọc Chương in ra trong ngoặc: Nhập môn 3 mục, chương 1 Chú ý 15, chương 2 Trộn chuyên gia 12, chương 3 Vị trí 9, chương 4 Sinh nhanh 11, chương 5 Ít bit 11, chương 6 Huấn luyện 16, chương 7 Đọc mô hình 11, chương 8 Tra cứu 6. Cộng lại đúng 94, và phép cộng đó là một bất biến cổng khoá chứ không phải một con số tôi gõ vào.

Núm bỏ dấu, và chỗ nó thật sự đổi kết quả

Núm Bỏ dấu không phải trang trí. Nó quyết định hai phía được so bằng cái gì: bật thì cả chuỗi bạn gõ lẫn nội dung bảng đều bị gỡ dấu và hạ hoa thường trước khi so, tắt thì chỉ hạ hoa thường. Ba truy vấn dưới đây cho thấy ba hành vi khác hẳn nhau, và bạn tự gõ lại được:

  • rope: 6 mục ở cả hai chế độ. Chuỗi thuần chữ Latin không dấu thì không có gì để gỡ, nên núm đứng im. Đây là ca mà núm trơ, và nó trơ đúng.
  • chu: 35 mục khi bỏ dấu, 22 mục khi giữ dấu. Cả hai đều khác 0, nên đây không phải cái công tắc tất cả hoặc không gì cả.
  • chuyen gia: 10 mục khi bỏ dấu, 0 mục khi giữ dấu. Đây là ca thường gặp nhất trên bàn phím Việt. Mục thứ mười khớp qua phần định nghĩa chứ không qua tên, vì mục Byte trọng số phải nạp có nhắc tới trộn chuyên gia.

Đáng nhìn kỹ nhất là mốc giữa hai hành vi đầu, vì nó cách nhau đúng một ký tự. Gõ chuy thì cả hai chế độ đều ra 13 mục, vì chuy là tiền tố nguyên văn của chuyên. Gõ thêm một chữ thành chuye thì chế độ bỏ dấu vẫn 13, còn chế độ giữ dấu tụt thẳng về 0, vì chữ tiếp theo trong bảng là ê chứ không phải e. Một ký tự, và núm đi từ vô nghĩa sang quyết định tất cả. Cổng khoá cả bốn con số đó, đúng trên mốc và đúng một bước sau mốc, vì một khẳng định chỉ đứng giữa hai mốc thì không thấy gì.

Ba mốc biên mà trang này phải xử đúng

Một bảng tra hỏng thường hỏng ở rìa chứ không hỏng ở giữa, nên ba trường hợp sau đều có khẳng định riêng:

  • Chuỗi tìm rỗng trả về toàn bộ 94 mục. Khoảng trắng thuần cũng vậy: gõ ba dấu cách vẫn ra đúng 94, không phải 0.
  • Chuỗi không khớp gì trả về đúng 0, và giao diện phải nói ra.zzzqqq thì bảng không im lặng hiện một khung trắng, nó nói thẳng là 0 trên 94 và gợi ý ba cách sửa, trong đó có việc bật lại núm bỏ dấu.
  • Chuỗi quá dài bị cắt và được báo. Trần là 60 ký tự. Ở đúng 60 thì không có gì xảy ra, ở 61 thì chuỗi bị cắt còn 60 và một dòng cảnh báo hiện ra nói rõ đã cắt từ bao nhiêu xuống bao nhiêu. Việc kẹp nằm ở đúng một chỗ trong engine, và cổng chứng minh điều đó bằng cách đưa một chương bịa vào thẳng phần tính: nó ra 0 mục chứ không được tự sửa thành 94.
Điều rút ra

Đừng đọc trang này theo thứ tự. Khi gặp một từ lạ, gõ ba bốn chữ đầu của nó, đọc đúng một câu định nghĩa, rồi bấm vào bài dạy nếu vẫn thấy mờ. Nếu bạn đang ôn cả một chương thì đổi sang sắp xếp Theo chương và lọc đúng chương đó để thấy toàn bộ vốn từ của chương gom lại một chỗ. Nhớ hai giới hạn: bảng chỉ chứa 94 thuật ngữ đã được dạy trong 24 bài của học phần này, và nó chỉ định nghĩa chứ không khuyên chọn. Muốn biết nên làm kỹ thuật nào trước thì sang bài chọn kỹ thuật theo nút thắt: trang đó tính byte cắt được, còn trang này chỉ định nghĩa. Con số bên phải thanh công cụ luôn là độ dài thật của danh sách, còn núm Bỏ dấu thì có lúc đổi kết quả từ 10 xuống 0 và có lúc không đổi gì cả, tuỳ chuỗi bạn gõ có dấu để gỡ hay không.

Câu hỏi tự kiểm0/3 đúngchưa trả lời
  1. 1Bạn gõ "chuy" vào ô tìm kiếm và được 13 mục. Bấm tắt núm "Bỏ dấu", con số vẫn là 13. Kết luận nào đúng?
  2. 2Cổng kiểm của trang khẳng định "mọi bài của học phần đều có ít nhất một thuật ngữ trỏ tới". Vì sao cần chiều khẳng định này khi đã có chiều "mọi đường dẫn đều trỏ tới tệp có thật"?
  3. 3Bạn gõ ba dấu cách vào ô tìm kiếm. Con số hiển thị phải là bao nhiêu, và vì sao?