Tất cả bài viết · Đăng ngày 2026-08-04

Biện hộ cho “cày đề”: Wittgenstein, các nhà ngôn ngữ học, khoa học trí nhớ và AI cùng ra làm chứng

“Cày đề” — tiếng Trung gọi là 刷題 — dường như mang sẵn một thứ nguyên tội: nghe như sản phẩm của lò luyện thi, di sản của nền giáo dục chạy theo điểm số, thủ phạm khiến người ta “thi điểm cao mà không nói được tiếng Anh” — như thể việc học ngôn ngữ đích thực diễn ra ở một nơi nào khác, còn cày đề chỉ là món hàng thay thế rẻ tiền. Bài viết này sẽ nghiêm túc biện hộ cho việc cày đề. Ra làm chứng có một trong những triết gia ngôn ngữ quan trọng nhất thế kỷ XX, vài nhà ngôn ngữ học đã thật sự ngồi đếm ngữ liệu, những hiệu ứng được kiểm chứng suốt hơn một thế kỷ trong khoa học trí nhớ — và một nhân chứng bất ngờ: chính mô hình ngôn ngữ lớn. Xin nói trước phán quyết: cày đề không phải đường vòng trong việc học ngôn ngữ; nếu bạn không thể chuyển đến một nước nói tiếng Anh, đây là con đường gần với đường thẳng nhất.

Cáo buộc là gì

Trước hết, hãy nghe trọn lời buộc tội; nó đáng được xem xét nghiêm túc.

Lập luận phê phán đại khái thế này: ngôn ngữ dùng để giao tiếp, không phải để thi. Suốt ngày làm câu hỏi trắc nghiệm chỉ rèn “kỹ thuật làm bài” — loại trừ đáp án, đối chiếu từ khóa, phản xạ theo dạng câu hỏi — chứ không rèn chính ngôn ngữ. Bởi vậy thí sinh Đông Á mới “điểm rất cao nhưng không mở miệng nói được”; bởi vậy “cày đề” mới nghe giống một nỗi ám ảnh thi cử thiếu lành mạnh chỉ có ở Đông Á, một sự sùng bái kỳ thi hơn là học ngôn ngữ.

Cáo buộc ấy nghe thuyết phục vì bên dưới nó ẩn một tiền đề tưởng như hiển nhiên:

Ngôn ngữ là một tập hợp quy tắc cộng với một kho từ vựng. Nắm được quy tắc là bạn đã “biết” ngôn ngữ ấy; câu hỏi chỉ là công cụ kiểm tra xem bạn có biết hay không. Lặp đi lặp lại phép kiểm tra sẽ không khiến bạn biết thêm.

Nếu tiền đề này đúng, cày đề quả thật đáng ngờ — khám sức khỏe một trăm lần cũng không làm cơ thể khỏe hơn.

Vấn đề là tiền đề ấy sai. Và quá trình bác bỏ nó là một trong những cuộc chuyển hướng nổi tiếng nhất của triết học thế kỷ XX.


Một triết gia đổi ý

Ludwig Wittgenstein viết hai cuốn sách, đại diện cho hai cách nhìn về ngôn ngữ — và cuốn thứ hai được viết để phá bỏ cuốn thứ nhất.

Cuốn đầu tiên, Tractatus Logico-Philosophicus, cho rằng bản chất của ngôn ngữ là logic: mệnh đề là hình ảnh của sự kiện; phân tích rõ cấu trúc logic thì ngôn ngữ sẽ trở nên trong suốt. Khi sách xuất bản, Wittgenstein tin rằng mình đã giải quyết xong các vấn đề triết học, rồi về một vùng quê nước Áo dạy tiểu học. Hãy để ý mối họ hàng giữa tiền đề này và tiền đề ở phần trước: nếu ngôn ngữ thật sự có thể quy giản thành một hệ thống quy tắc gọn ghẽ, thì “học quy tắc” là đường chính, còn “tiếp xúc thật nhiều” chỉ là cách làm vụng về.

Rồi ông đổi ý. Một triết gia công khai bác bỏ chính mình là chuyện hiếm — phần lớn dành cả đời bảo vệ công trình thời trẻ — mà thứ Wittgenstein bác bỏ lại chính là kiệt tác đã làm nên tên tuổi của ông. Philosophical Investigations thời kỳ sau gần như tháo dỡ từng luận điểm cũ, để rồi làm lộ ra mệnh đề cốt lõi: ý nghĩa của một từ không nằm trong định nghĩa, mà nằm trong cách từ ấy thực sự được dùng trong ngôn ngữ. Ngôn ngữ không phải một hệ thống logic lơ lửng giữa không trung, mà là vô số “trò chơi ngôn ngữ” gắn vào đời sống; hình dung một ngôn ngữ là hình dung một dạng thức sống.

Ông còn để lại một lập luận đặc biệt quan trọng với người học, về sau được gọi là “nghịch lý tuân theo quy tắc”: không một quy tắc nào được phát biểu tường minh có thể tự nó quyết định hoàn toàn cách áp dụng — bạn vẫn cần cái khả năng “biết dùng quy tắc này như thế nào”, mà khả năng ấy không phải thêm một quy tắc khác; đó là cảm giác được rèn qua thực hành. Nói theo ngôn ngữ luyện thi: mỗi quy tắc trong sách ngữ pháp đều ngầm giả định một độc giả đã gặp đủ nhiều ví dụ. Quy tắc là sự hệ thống hóa sau sự việc, không phải cỗ máy sinh ngôn ngữ từ trước.

Thú vị nhất là từ ông chọn để mô tả điểm khởi đầu của ngôn ngữ. Khi nói về cách trẻ em học tiếng mẹ đẻ, ông dùng từ Đức Abrichtung — một từ thường chỉ việc huấn luyện động vật, gần với “luyện” hơn cả. Theo ông, việc dạy ngôn ngữ “không phải là giải thích, mà là huấn luyện”. Một trong những triết gia ngôn ngữ sâu sắc nhất thế kỷ XX, khi mô tả việc học ngôn ngữ, đã chọn một ẩn dụ gần với “cày” hơn nhiều so với “giảng giải”.

Đó cũng là lý do trang “Về chúng tôi” của Chinh Phục 990 viết: Về quan điểm học ngôn ngữ, chúng tôi khá đồng tình với Wittgenstein thời kỳ sau: ngôn ngữ của con người không thể chỉ tóm gọn trong một vài quy tắc ngữ pháp đơn giản. Trải qua quá trình tiến hóa lâu dài, ngôn ngữ đã để lại quá nhiều quy ước không theo logic thông thường — bạn không thể chỉ học từ give và in rồi tự suy luận ra give in nghĩa là "nhượng bộ". Nếu ngôn ngữ thực sự hợp tình hợp lý đến thế, nó đã tự nhượng bộ bạn từ lâu rồi.


Các nhà ngôn ngữ học đã đếm: Phần cốt lõi của ngôn ngữ là quy ước

Triết học chỉ ra phương hướng; ngôn ngữ học cung cấp những con số.

Năm 1983, Pawley và Syder nêu một nhận xét mà từ đó cả lĩnh vực không thể làm ngơ: các quy tắc ngữ pháp chủ yếu tạo ra những câu “hoàn toàn đúng ngữ pháp, nhưng chẳng ai nói như thế”. Khi hỏi giờ, ngữ pháp đều cho phép "What is the hour?" và "How late is it?" (đúng theo logic của tiếng Hà Lan) — tất cả đều hợp lệ, nhưng chỉ "What time is it?" mới là tiếng Anh tự nhiên. Sự trôi chảy của người bản ngữ không dựa vào việc tính toán quy tắc trong thời gian thực, mà vào khả năng lấy thẳng những cách diễn đạt làm sẵn từ một kho quy ước khổng lồ.

Ngôn ngữ học ngữ liệu sau đó đã định lượng hiện tượng này. Sau khi khảo sát ngữ liệu thực tế, Sinclair đề xuất “nguyên lý thành ngữ”: nguyên tắc đầu tiên của việc dùng ngôn ngữ không phải là tự do lắp ghép theo quy tắc, mà là chọn từ những mảnh đã làm sẵn. Erman và Warren (2000) thực sự ngồi đếm: lấy ngẫu nhiên một đoạn tiếng Anh xác thực, xấp xỉ một nửa được kết thành từ những tổ hợp lớn nhỏ đã định hình như vậy. Chuyên khảo của Wray (2002) cũng đi đến kết luận tương tự: các chuỗi công thức không phải phần vụn bên lề ngôn ngữ; chúng là phần cốt lõi.

Mà chính logic lại không thể suy ra những quy ước ấy:

  • heavy rain không thể đổi thành strong rain, nhưng strong coffee cũng không thể đổi thành heavy coffee;
  • ta nói make a decision, nhưng lại nói do homework;
  • cách nhận lời trước câu "Would you mind closing the window?" là "Not at all" — theo logic là “Tôi hoàn toàn không phiền”, theo quy ước là “Được, tôi sẽ đóng”;
  • trước câu "You haven't sent the report, have you?", tiếng Anh trả lời theo sự thật bằng "No" (tôi chưa gửi), còn trực giác tiếng Việt sẽ đáp “Vâng (đúng vậy, tôi chưa gửi)” — tức đồng tình với mệnh đề. Không bên nào logic hơn; đây là hai hệ quy ước khác nhau.

Giờ hãy nhìn vào những gì TOEIC kiểm tra: Part 5 kiểm tra kết hợp từ và cách dùng quen thuộc, Part 2 kiểm tra quy ước đáp lời, Part 3 và 4 kiểm tra những kịch bản cố định trong hội thoại nơi làm việc, Part 6 và 7 kiểm tra các cách diễn đạt khuôn mẫu trong thư tín thương mại như "Please find attached", "effective immediately". Đây không phải kiến thức vụn vặt để đi thi; đây chính là phần cốt lõi của ngôn ngữ — cái phần chiếm một nửa ngữ liệu mà các nhà ngôn ngữ học đã đếm. Về bản chất, một ngân hàng câu hỏi TOEIC tốt là tuyển tập quy ước tiếng Anh công sở được trình bày dưới dạng trắc nghiệm.


Não bộ vốn học theo cách này: Tần suất và thống kê

Nếu không thể suy luận ra quy ước, ta chỉ có thể hấp thụ chúng qua tiếp xúc. May thay, não bộ được thiết kế chính cho việc đó.

Trong thí nghiệm kinh điển của Saffran, Aslin và Newport (1996), trẻ tám tháng tuổi chỉ cần nghe hai phút một chuỗi âm tiết nhân tạo liên tục đã có thể tách ra ranh giới của các “từ” chỉ nhờ quy luật thống kê về những âm tiết đi liền nhau. Não bộ là một cỗ máy thống kê — và cỗ máy thống kê chỉ chạy bằng một thứ nhiên liệu: cỡ mẫu.

Lý thuyết dựa trên cách dùng của Tomasello nối kết điều này với việc thụ đắc ngôn ngữ: trẻ em không nhận trước một bộ ngữ pháp rồi đem áp dụng; chúng tự quy nạp những cấu trúc ngày càng trừu tượng từ hết tình huống sử dụng cụ thể này đến tình huống khác. Nick Ellis (2002) mở rộng lập luận sang ngôn ngữ thứ hai: việc học ngoại ngữ ở người lớn phần lớn cũng là quá trình thống kê ngầm trên dữ liệu đầu vào — mỗi lần tiếp xúc lại đánh thêm một dấu cho một kết hợp từ, một cấu trúc nào đó. Tần suất không phải yếu tố hỗ trợ. Nó là yếu tố chính.

Điều này cũng giải thích lời khuyên mà ai cũng đồng ý: “Cách tốt nhất để học một ngôn ngữ là chuyển đến nơi người ta nói ngôn ngữ ấy.” Đắm mình trong ngôn ngữ có hiệu quả không phải vì tiếng Anh bay trong không khí, mà vì liều lượng — sống trong môi trường tiếng Anh nghĩa là mỗi ngày thụ động gặp hàng nghìn mẫu quy ước, cỗ máy thống kê chạy hết công suất. Wittgenstein hẳn sẽ nói: bạn đã bước vào dạng thức sống ấy.

Nếu không thể chuyển đi, bạn phải tự thiết kế liều lượng cho mình. Đọc rộng là một cách; cày đề là một cách khác — và như phần sau sẽ cho thấy, đó là cách có ưu thế về hiệu quả đã được đo lường.


Khoa học trí nhớ: Làm câu hỏi hơn đọc lại, trả lời sai hơn không bao giờ sai

Giả sử ta đồng ý rằng tiếp xúc thật nhiều là cần thiết, vẫn còn một câu hỏi: hình thức tiếp xúc có quan trọng không? Đọc mười bài báo và làm mười câu hỏi có phần giải thích liệu có như nhau?

Không — và câu trả lời có thể ngược với trực giác. Một trong những phát hiện được tái lập vững chắc nhất trong khoa học trí nhớ là “hiệu ứng kiểm tra”: Roediger và Karpicke (2006) cho các đối tượng nghiên cứu cùng một đoạn văn, một nhóm đọc đi đọc lại, nhóm kia làm bài kiểm tra; một tuần sau, nhóm được kiểm tra ghi nhớ vượt trội. Đọc lại tạo ảo giác trôi chảy rằng “mình biết rồi”; chính việc truy hồi mới để lại dấu vết. Karpicke và Blunt (2011), trong một nghiên cứu đăng trên Science, còn đi xa hơn: luyện tập truy hồi vượt qua cả lập bản đồ khái niệm, một kỹ thuật học tập vốn được xem là tinh vi.

Bjork gom nhóm hiện tượng này dưới tên “khó khăn đáng mong muốn”: việc học càng có vẻ trơn tru, dấu vết để lại càng ít; điều não phải nhọc công lôi ra mới bám chắc. Trả lời câu hỏi biến mỗi lần tiếp xúc thành một lượt truy hồi — bạn không thể lướt qua; bạn buộc phải đưa ra phán đoán.

Ngay cả câu trả lời sai cũng có ích. Kornell và các cộng sự cho thấy đoán sai rồi mới xem đáp án đúng giúp nhớ tốt hơn việc được cho xem đáp án ngay từ đầu. Vì thế, câu sai không phải hồ sơ thất bại — nó là danh mục những lỗ hổng quy ước của bạn, mỗi câu một mục, có tọa độ rõ ràng. Sai "meet a deadline" một lần ở Part 5, quy ước ấy sẽ được đánh dấu; lần tới gặp nó trong một email thật, bạn sẽ không còn coi nó như tạp âm nền.

Đặt những chỉ định của khoa học học tập cạnh những gì cày đề mang lại, hai cột khớp nhau đến gần như đáng ngượng:

Khoa học học tập khuyến nghị Cày đề mang lại
Tiếp xúc thật nhiều với các quy ước xác thực Mỗi câu là một mẫu cô đặc: một bức thư thương mại, một cuộc gọi chăm sóc khách hàng, một lời đáp tự nhiên
Truy hồi, không phải đọc lại Mỗi câu buộc bạn đưa ra phán đoán — lướt thụ động không được tính
Phản hồi tức thì Bạn biết ngay mình đúng hay sai, và phần giải thích cho biết vì sao
Học từ lỗi sai Câu sai xác định chính xác quy ước bạn chưa nội hóa
Học cách quãng Năm câu trên tàu, ba câu khi xếp hàng — tự nhiên giãn ra qua nhiều ngày, hiệu quả hơn nhồi nhét một tuần trước kỳ thi

Tách hành động “cày đề” ra, ta có: tiếp xúc dày đặc với quy ước × buộc phải truy hồi × phản hồi tức thì × giãn cách tự nhiên. Không yếu tố nào trong bốn yếu tố này là “kỹ thuật làm bài”. Cả bốn đều nằm trong danh sách khuyến nghị của khoa học học tập.


Vì sao mô hình ngôn ngữ lớn phải có chữ “lớn”

Các nhân chứng con người đã trình bày xong. Nhân chứng cuối cùng khá khác thường — không phải con người và chỉ mới học nói được vài năm.

Ban đầu, các nhà khoa học máy tính dạy máy móc ngôn ngữ dựa đúng vào tiền đề ở đầu bài: viết ngữ pháp thành quy tắc, dựng từ vựng thành từ điển, rồi để chương trình phân tích và sinh ngôn ngữ theo đó. Hướng nghiên cứu này được theo đuổi nghiêm túc suốt hàng chục năm, và kết cục thì ai cũng biết — chạy ổn với những câu đồ chơi, nhưng vỡ vụn trước ngôn ngữ thực; quy tắc cứ sinh sôi, ngoại lệ cứ chắp vá cho ngoại lệ, mãi mãi đuổi theo cách ngôn ngữ thật sự vận hành. Fred Jelinek, người tiên phong trong nhận dạng tiếng nói, được cho là từng đùa rằng mỗi lần ông sa thải một nhà ngôn ngữ học, độ chính xác nhận dạng lại tăng lên. Câu đùa ấy trở thành một tấm biển chỉ đường cho cả lĩnh vực.

Bước đột phá thực sự đến từ việc từ bỏ hoàn toàn cách “viết quy tắc trước”: phương pháp thống kê, rồi học sâu, rồi mô hình ngôn ngữ lớn. Lần đầu tiên máy tính xử lý được ngôn ngữ tự nhiên ra hồn không phải vì cuối cùng có người viết xong toàn bộ ngữ pháp, mà vì các mô hình được ngâm trong hàng nghìn tỷ từ của văn bản thật và thống kê từng quy ước một — đúng con đường Wittgenstein đã chỉ. Rich Sutton cô đọng lịch sử ấy trong bài luận nổi tiếng "The Bitter Lesson": những cách tiếp cận cài sẵn tri thức chuyên gia của con người hết lần này đến lần khác thua các cách để hệ thống tự học bằng dữ liệu và năng lực tính toán.

Chữ “lớn” mới là điểm mấu chốt. Nếu ngôn ngữ thật sự có thể quy giản thành vài quy tắc, mô hình chẳng cần lớn — chỉ việc cài quy tắc vào là xong; vài nghìn dòng mã đã đủ. Mô hình buộc phải khổng lồ và kho ngữ liệu buộc phải mênh mông chính vì phần cốt lõi của ngôn ngữ là một kho quy ước không thể quy giản, chỉ có thể ghi nhớ từng mục. Số lượng tham số của một mô hình lớn có thể được đọc như câu trả lời kỹ thuật cho câu hỏi “một ngôn ngữ thật sự chứa bao nhiêu quy ước?” — và câu trả lời lên tới hàng tỷ, hàng nghìn tỷ.

Hay hơn nữa, hãy nhìn cách chúng được huấn luyện; bạn sẽ thấy quen thuộc. Che từ tiếp theo; bắt mô hình đoán; kiểm tra đáp án; điều chỉnh; sang câu kế tiếp. Hàng tỷ câu mỗi ngày. Trong bài báo về BERT, mục tiêu huấn luyện được gọi đúng là cloze task — cùng dạng câu hỏi với TOEIC Part 5 và Part 6. Nói cách khác, dự án quy mô lớn duy nhất trong lịch sử đã dạy thành công một ngôn ngữ tự nhiên cho một “ai đó” không phải con người đã dùng chính cách cày đề — chỉ khác ở khối lượng thiên văn.

Dĩ nhiên, não người không phải transformer, và không nên đẩy phép so sánh này quá xa. Nhưng hướng kết luận của phép đối chiếu thì khó né tránh. Máy móc không theo triết thuyết nào và cũng chẳng có ý kiến về văn hóa học tập Đông Á; chúng chỉ báo lại thứ gì có hiệu quả. Con đường suy ra ngôn ngữ từ quy tắc đã thất bại. Con đường hấp thụ quy ước ở quy mô lớn đã tạo ra thứ mà giờ đây bạn có thể trò chuyện cùng.


Điều cần phân biệt và điều cần thừa nhận

Một lời biện hộ chỉ đáng tin khi vạch rõ ranh giới. Trước hết, cần phân biệt hai điều:

Cày đề không phải luyện mẫu câu máy móc. Kiểu “luyện mẫu câu” của chủ nghĩa hành vi thập niên 1960 — lặp lại việc biến đổi khung câu mà không gắn với ý nghĩa — đã bị giới giảng dạy ngôn ngữ loại bỏ một cách chính đáng; nếu các nhà phê bình nói đến thứ đó, họ đúng. Nhưng câu hỏi TOEIC không phải như vậy: mỗi câu đều buộc bạn xử lý ý nghĩa — đọc hiểu một đoạn văn hoặc nghe hiểu một cuộc hội thoại, rồi đưa ra phán đoán về ý nghĩa. Theo cách nói của Krashen, đây là “đầu vào có thể hiểu được”; một ngân hàng câu hỏi tốt là một chồng đầu vào có thể hiểu được, xếp theo độ khó và kèm lời giải.

Trong một bài kiểm tra khả năng hiểu, “luyện thi” và “học” gần như trùng nhau. TOEIC L&R không có bài luận để học thuộc khuôn, không có câu tự luận để đoán đề; hai trăm câu đều chỉ hỏi “bạn có hiểu điều mình đọc không?”, “bạn có hiểu điều mình nghe không?”. Trong một kỳ thi đo khả năng hiểu, kỹ thuật làm bài tốt nhất chính là hiểu. Đây là lý do mang tính cấu trúc khiến TOEIC đáng để cày đề — hiếm khi con đường đến điểm số và con đường học tiếng Anh lại là cùng một con đường như vậy.

Sau đó, cần thừa nhận ba điều:

  1. Cày đề không rèn khả năng sản sinh ngôn ngữ. Giả thuyết đầu ra của Swain và giả thuyết tương tác của Long đều chỉ ra rằng: muốn nói và viết, bạn phải thật sự nói và viết. Cày đề lo phần đầu vào; hãy bố trí riêng cho phần đầu ra. (Công bằng mà nói: TOEIC L&R vốn cũng chỉ kiểm tra đầu vào.)
  2. Học thuộc đáp án không phải cày đề. Nếu “cày” nghĩa là nhớ “câu này chọn B”, các nhà phê bình hoàn toàn đúng. Phần học nằm ngay trong câu hỏi: đoạn văn cần đọc, âm thanh cần nghe, lời giải cần xem, câu sai cần quay lại. Thứ bạn cày là tiếng Anh trong câu hỏi, không phải chữ cái bên cạnh số câu.
  3. Chất lượng câu hỏi quyết định chất lượng tiếp xúc. Thứ bạn tiếp xúc ở cường độ cao là ngôn ngữ bên trong câu hỏi — vì vậy nó phải là tiếng Anh thật. Một ngân hàng câu hỏi cẩu thả khiến bạn tiếp xúc hàng loạt với những quy ước không tồn tại, còn tệ hơn không cày đề. Đó là lý do chúng tôi coi độ khó và tính nguyên bản là những bài toán kỹ thuật (xem Tổng quan về độ khó để biết cách làm).

Kết: Cứ yên tâm mà cày

Quay lại cáo buộc ban đầu: “Cày đề chỉ là luyện thi, không phải học.” Giờ ta có thể trả lời đầy đủ.

Nếu ngôn ngữ thật sự là một tập quy tắc, cáo buộc ấy đúng — đo lường không cải thiện thứ được đo. Nhưng một triết gia đã dành nửa sau cuộc đời để chứng minh ngôn ngữ không phải như vậy; các nhà ngôn ngữ học đếm được rằng quy ước chiếm một nửa ngữ liệu thực; các nhà tâm lý học chứng minh trả lời câu hỏi để lại nhiều hơn đọc lại, và trả lời sai dạy được nhiều hơn không bao giờ sai; còn các kỹ sư bổ sung bằng chứng sống — “học viên” duy nhất mà con người từng dạy thành công một ngôn ngữ tự nhiên đã được huấn luyện bằng cách cày đề ở quy mô thiên văn. Bốn luồng lời chứng cùng chỉ về một kết luận: công việc chủ yếu khi học ngôn ngữ là tiếp xúc thật nhiều, lặp đi lặp lại và có phản hồi với cách ngôn ngữ ấy thực sự được sử dụng — và cày đề làm đúng việc đó, vừa rẻ vừa hiệu quả.

Ngôn ngữ không nghe theo lý lẽ, nên bạn chỉ còn cách thường xuyên gặp nó. Cày đề là cách bạn lên lịch cho những cuộc gặp ấy — trên tàu, khi xếp hàng, chỉ với một tay rảnh.

Tên tiếng Trung của Chinh Phục 990 là 單手刷990, nghĩa xấp xỉ “một tay cày đề tới 990”. Chữ “cày” nằm ngay trong tên. Đó không phải lời tự giễu; đó là một lập trường.

← Tất cả bài viết