[Research Contribution] Ứng dụng PhoBERT tự động phân loại yêu cầu hỗ trợ sinh viên tại UEH

24 Tháng Chín, 2026

Từ khóa: PhoBERT; Trí tuệ nhân tạo; Xử lý ngôn ngữ tự nhiên; Chuyển đổi số đại học; CRM/Ticket; Hỗ trợ sinh viên; UEH.

Gần 47.000 yêu cầu hỗ trợ sinh viên phát sinh trên hệ thống CRM/Ticket của Đại học Kinh tế Thành phố Hồ Chí Minh (UEH) đã trở thành nguồn dữ liệu cho một nghiên cứu ứng dụng trí tuệ nhân tạo vào hoạt động quản trị đại học. Thông qua thử nghiệm và so sánh nhiều mô hình học máy, nghiên cứu đề xuất sử dụng PhoBERT để tự động phân loại, điều phối yêu cầu đến các đơn vị phụ trách. Công trình đã được trao Best Paper Award tại International Conference on Next-Generation Data Engineering and Analytics (INDEA-2026), tổ chức với University of Salford, Manchester, Vương quốc Anh, tháng 8/2026.

Thumb Youtube

Trong tiến trình chuyển đổi số đại học, dữ liệu phát sinh từ hoạt động vận hành có thể trở thành nguồn lực quan trọng để nhận diện vấn đề và cải tiến chất lượng phục vụ người học. Tại UEH, hệ thống CRM/Ticket được triển khai nhằm tiếp nhận các yêu cầu của sinh viên liên quan đến học phí, đăng ký học phần, thi cử, thư viện, cơ sở vật chất và nhiều dịch vụ khác.

Khi số lượng yêu cầu ngày càng gia tăng, quá trình đọc hiểu, phân loại và chuyển từng ticket đến đúng đơn vị chức năng đặt ra yêu cầu về tốc độ, tính nhất quán và khả năng xử lý trên quy mô lớn. Từ bài toán này, nhóm nghiên cứu gồm TS. Nguyễn Quốc Hùng và Châu Quốc Long đã thực hiện công trình “Applying the PhoBERT Language Model for Automated Classification of Student Support Tickets at the University of Economics Ho Chi Minh City (UEH)” (Ứng dụng mô hình ngôn ngữ PhoBERT để tự động phân loại các yêu cầu hỗ trợ sinh viên tại Đại học Kinh tế Thành phố Hồ Chí Minh – UEH).

Từ bài toán vận hành đến câu hỏi nghiên cứu

Yêu cầu hỗ trợ của sinh viên thường được thể hiện dưới dạng văn bản tự nhiên, với cách diễn đạt, độ dài và mức độ rõ ràng khác nhau. Một số ticket có nội dung cụ thể, trong khi những ticket khác có thể đề cập đồng thời nhiều vấn đề hoặc nằm ở vùng giao thoa về chức năng giữa các đơn vị.

Điều này khiến việc tự động nhận diện nội dung và xác định đơn vị xử lý phù hợp trở thành một bài toán phức tạp về xử lý ngôn ngữ tự nhiên. Nghiên cứu vì vậy tập trung trả lời câu hỏi: Liệu mô hình ngôn ngữ được phát triển chuyên biệt cho tiếng Việt có thể hỗ trợ hệ thống hiểu nội dung yêu cầu và tự động phân loại ticket với độ chính xác đủ cao để ứng dụng trong thực tế hay không?

Để trả lời câu hỏi này, nhóm nghiên cứu xây dựng một quy trình gồm làm sạch và chuẩn hóa dữ liệu; thiết lập trường văn bản và nhãn phân loại; phân chia tập huấn luyện, xác thực và kiểm tra; triển khai các mô hình thực nghiệm; so sánh kết quả; phân tích lỗi và đánh giá khả năng tích hợp vào hệ thống hiện hữu.

Nghiên cứu sử dụng dữ liệu được ghi nhận trên hệ thống CRM/Ticket UEH trong giai đoạn từ tháng 6/2022 đến ngày 31/10/2025. Sau quá trình làm sạch và chuẩn hóa, bộ dữ liệu gồm 46.874 ticket, được gắn nhãn theo sáu đơn vị chức năng.

Việc khai thác trực tiếp dữ liệu phát sinh trong quá trình vận hành giúp nghiên cứu phản ánh tương đối sát đặc điểm ngôn ngữ, nhu cầu hỗ trợ và cơ chế điều phối yêu cầu trong môi trường đại học. Trên cơ sở đó, nhóm nghiên cứu phân tích sự phân bố giữa các nhóm ticket, nhận diện đặc điểm nội dung và những trường hợp có khả năng gây nhầm lẫn, làm tiền đề cho việc lựa chọn mô hình và thiết kế thực nghiệm.

PhoBERT đạt hiệu quả cao nhất trong các mô hình được khảo sát

Nghiên cứu lựa chọn PhoBERT – mô hình ngôn ngữ được phát triển chuyên biệt cho tiếng Việt – làm trọng tâm, đồng thời triển khai nhiều mô hình đối chứng để đánh giá kết quả trên cơ sở so sánh.

Các phương pháp học máy truyền thống được khảo sát gồm Logistic Regression, Linear SVM và Random Forest. Ở nhóm mô hình Transformer, nghiên cứu thử nghiệm mBERT, XLM-R và PhoBERT.

Kết quả cho thấy các mô hình Transformer đạt hiệu quả cao hơn nhóm phương pháp học máy truyền thống trong bài toán phân loại yêu cầu hỗ trợ sinh viên. Trong số các mô hình được khảo sát, PhoBERT đạt Accuracy 0,944 và Macro-F1 0,946, cao nhất trong bảng kết quả so sánh của công trình. Đây là cơ sở thực nghiệm để nhóm nghiên cứu đề xuất PhoBERT cho bài toán tự động phân loại yêu cầu tại UEH.

Bên cạnh các chỉ số tổng thể, nhóm nghiên cứu còn phân tích confusion matrix và những trường hợp dự đoán sai. Kết quả cho thấy lỗi thường xuất hiện khi nội dung ticket có sự giao thoa giữa phạm vi phụ trách của nhiều đơn vị hoặc chứa đồng thời nhiều ý định. Việc nhận diện những giới hạn này giúp xác định trường hợp nào có thể tự động hóa và trường hợp nào vẫn cần cán bộ chuyên môn kiểm tra, điều chỉnh.

Hướng đến tích hợp vào hệ thống CRM/Ticket UEH

Từ kết quả thực nghiệm, nghiên cứu lựa chọn cấu hình PhoBERT Weighted làm phương án đề xuất, xây dựng bản demo phân loại ticket và định hướng triển khai mô hình dưới dạng RESTful API để kết nối với hệ thống CRM/Ticket.

Theo hướng tiếp cận này, khi sinh viên gửi yêu cầu, mô hình có thể phân tích nội dung, dự đoán nhóm chức năng phù hợp và hỗ trợ định tuyến ticket đến đơn vị phụ trách. Giải pháp kỳ vọng góp phần rút ngắn thời gian tiếp nhận, giảm khối lượng phân loại thủ công và nâng cao tính nhất quán trong quá trình điều phối.

Trong quá trình ứng dụng, AI đóng vai trò hỗ trợ nhận diện và phân loại ban đầu. Những trường hợp có độ tin cậy thấp, chứa nhiều ý định hoặc chưa xác định rõ đơn vị phụ trách vẫn cần được chuyển đến cán bộ chuyên môn để kiểm tra. Cơ chế phối hợp giữa mô hình và con người là điều kiện cần thiết để duy trì độ chính xác, khả năng kiểm soát và chất lượng hỗ trợ sinh viên.

Từ bài toán trên hệ thống CRM/Ticket, nghiên cứu hình thành một chuỗi giá trị tương đối hoàn chỉnh: dữ liệu thực tiễn – nghiên cứu khoa học – giải pháp công nghệ – khả năng ứng dụng – đóng góp học thuật.

Từ đề án thạc sĩ đến công trình nghiên cứu quốc tế

Nghiên cứu được phát triển từ đề án thạc sĩ “Đề xuất mô hình PhoBERT trong phân loại tự động yêu cầu hỗ trợ sinh viên tại Đại học Kinh tế Thành phố Hồ Chí Minh (UEH)”, do Châu Quốc Long thực hiện dưới sự hướng dẫn khoa học của TS. Nguyễn Quốc Hùng. Trên cơ sở kết quả của đề án, nhóm tác giả tiếp tục hoàn thiện phương pháp, hệ thống hóa kết quả thực nghiệm và phát triển thành bài báo khoa học quốc tế.

Tháng 8/2026, công trình đã được trao Best Paper Award tại International Conference on Next-Generation Data Engineering and Analytics – INDEA-2026, tổ chức trong hai ngày 21–22/8/2026 với University of Salford, Manchester, Vương quốc Anh. Giải thưởng ghi nhận chất lượng khoa học và ý nghĩa ứng dụng của nghiên cứu, đồng thời cho thấy một vấn đề cụ thể trong vận hành đại học có thể được phát triển thành công trình có phương pháp, kết quả đo lường được và giá trị chia sẻ trên diễn đàn học thuật quốc tế.

Với UEH, gần 47.000 ticket hỗ trợ sinh viên, khi được chuẩn hóa và nghiên cứu bằng phương pháp phù hợp, đã trở thành cơ sở để phát triển giải pháp hỗ trợ quản trị, cải thiện quy trình và nâng cao trải nghiệm người học.

Công trình qua đó gợi mở một cách tiếp cận thiết thực đối với chuyển đổi số đại học: bắt đầu từ nhu cầu trong hoạt động vận hành, khai thác dữ liệu để nhận diện vấn đề và phát triển giải pháp dựa trên bằng chứng. Từ dữ liệu của UEH, nghiên cứu tạo ra tri thức và mở ra khả năng ứng dụng trở lại thực tiễn, góp phần thúc đẩy đổi mới quản trị và nâng cao chất lượng dịch vụ dành cho người học.

Tác giả: TS. Nguyễn Quốc Hùng, Châu Quốc Long – Đại học Kinh tế Thành phố Hồ Chí Minh.

Đây là bài viết nằm trong chuỗi bài lan tỏa nghiên cứu và kiến thức ứng dụng với thông điệp “Research Contribution For All – Nghiên Cứu Vì Cộng Đồng” do UEH thực hiện. UEH trân trọng kính mời Quý độc giả cùng đón xem bản tin tiếp theo.

Chân Trang (1)

Tin, ảnh: Tác giả, Ban Truyền thông và Phát triển đối tác UEH

Giọng đọc: Thanh Kiều 

abcd

18 Tháng Sáu, 2026

Chu kỳ giảm giá của đồng USD?

TS. Đinh Thị Thu Hồng và nhóm nghiên cứu

26 Tháng Sáu, 2021

Việt Nam cần kịch bản cho thương mại tương lai

ThS. Tô Công Nguyên Bảo

26 Tháng Sáu, 2021

Hệ thống tiền tệ tiếp theo như thế nào?

TS. Lê Đạt Chí và nhóm nghiên cứu

26 Tháng Sáu, 2021

Chuyển đổi số trong khu vực công tại Việt Nam

Khoa Quản lý nhà nước

26 Tháng Sáu, 2021

Cần đưa giao dịch công nghệ lên sàn chứng khoán

Bộ Khoa học và Công nghệ

5 Tháng Sáu, 2021

Thiết kế đô thị: tầm nhìn vững chắc cho đô thị bền vững

Viện Đô thị thông minh và Quản lý

5 Tháng Sáu, 2021

Phục hồi du lịch và nỗ lực thoát khỏi vòng xoáy ảnh hưởng bởi Covid-19

Viện Đô thị thông minh và Quản lý

5 Tháng Sáu, 2021

2021 sẽ là năm khởi đầu của chu kỳ tăng trưởng mới

PGS.TS Nguyễn Khắc Quốc Bảo

5 Tháng Sáu, 2021

Quỹ vaccine sẽ khả thi khi có người dân đóng góp

Phạm Khánh Nam, Việt Dũng

5 Tháng Sáu, 2021

Kích thích kinh tế, gia tăng vận tốc dòng tiền

Quách Doanh Nghiệp

5 Tháng Sáu, 2021

Đi tìm chiến lược hậu Covid-19 cho doanh nghiệp bảo hiểm Việt Nam

PGS TS Nguyễn Khắc Quốc Bảo, ThS Lê Văn

5 Tháng Sáu, 2021

Insurtech – Cơ hội và thách thức cho Startup Việt

Ths. Lê Thị Hồng Hoa

5 Tháng Sáu, 2021