AI sai chính tả và chuyện sai chính tả trong quá khứ


ChatGPT sai chính tả - ảnh do Gemini tạo

Năm 1631, ở London, hai nhà in hoàng gia Robert Barker và Martin Lucas cho ra lò một lô Kinh Thánh mới cứng. Mọi thứ đều ổn, cho đến khi ai đó lật tới Mười Điều Răn và đọc được một câu khiến cả nước Anh sốc tập thể: “Ngươi hãy phạm tội ngoại tình.”

Vâng, bạn không đọc nhầm đâu. Chỉ vì thiếu đúng một chữ “not”, lời răn dạy thiêng liêng nhất biến thành… lời khuyến khích. Hậu quả không hề vui: hai nhà in bị phạt 300 bảng, một khoản tiền khổng lồ thời đó, bị tước giấy phép, và gần như toàn bộ số sách bị tiêu hủy. Người đời sau đặt cho nó cái tên nghe như phim kinh dị: “Kinh Thánh độc ác” (The Wicked Bible). Ngày nay, vài cuốn còn sót lại trở thành đồ sưu tầm có giá trên trời. Đúng là sai một ly, đi một… gia tài.

Và nhân loại vẫn chưa rút kinh nghiệm. Năm 1962, NASA phải cho nổ tên lửa Mariner 1 chỉ vài phút sau khi phóng, vì một ký hiệu gạch bị bỏ sót trong công thức dẫn đường. Năm 2005, một nhân viên chứng khoán Nhật gõ nhầm, bán 610.000 cổ phiếu giá 1 yên thay vì 1 cổ phiếu giá 610.000 yên, và công ty bay mất hơn 200 triệu USD. Việt Nam cũng có câu chuyện “cười ra nước mắt”: năm 2020, cuốn Từ điển chính tả tiếng Việt bị thu hồi vì… sai chính tả.

Đến lượt AI “trượt tay”

Bước sang thời đại trí tuệ nhân tạo, nhiều người nghĩ máy móc sẽ chấm dứt nạn sai chính tả. Nhưng thỉnh thoảng bạn vẫn bắt gặp AI viết “chín tả” thay vì “chính tả”, hoặc đặt dấu hỏi thành dấu ngã một cách rất tự tin.

Lý do nằm ở cách AI “viết”. Nó không soạn cả câu rồi mới đọc lại, mà đoán từng mảnh chữ nhỏ gọi là token, mảnh này nối tiếp mảnh kia. Với tiếng Việt, một chữ như “chính” thường bị cắt thành vài mảnh, có khi riêng dấu thanh đã là một mảnh. Chỉ cần đoán lệch một mảnh là chữ bị méo ngay. Thêm nữa, AI không phải lúc nào cũng chọn phương án chắc chắn nhất, vì có một chút ngẫu nhiên để câu văn bớt khô cứng. Và phần lớn chatbot không có “biên tập viên” soát lại trước khi chữ hiện lên màn hình: bạn thấy chữ chạy ra đến đâu, đó là lúc AI vừa viết đến đó.

Nói cách khác, AI cũng giống người thợ in năm 1631: làm việc nhanh, thường là đúng, nhưng vẫn cần ai đó đọc lại.

Bài học gần 400 năm vẫn còn nguyên giá trị

Từ bản Kinh Thánh in tay đến chatbot chạy trên máy chủ, sự thật vẫn không đổi: lỗi nhỏ không đáng sợ, lỗi nhỏ nằm đúng chỗ quan trọng mà không ai kiểm tra mới đáng sợ.

Vậy nên, lần tới khi nhờ AI viết email cho sếp, hợp đồng cho đối tác hay caption bán hàng, hãy dành thêm mười giây đọc lại, hoặc bảo AI “soát chính tả giúp tôi” ở một lượt riêng. Tin mình đi, mười giây đó rẻ hơn 300 bảng Anh nhiều.

Suy cho cùng, AI thông minh đến mấy thì vẫn cần một người đọc lại cuối cùng, và người đó là bạn.

Giờ mới để ý là chữ tiếng Việt bị bẻ ra nhiều token, xưa giờ cứ nghĩ mỗi chữ là 1 token.

Gehihi khán nộn quá :rofl:

1 Like

Bọn nó bảo chữ TQ là tiết kiệm token nhất?