AWS Cloud Practitioner · Tiếng Việt
Chương 15 / 20

Machine Learning trên AWS

Tổng quan các dịch vụ AI/ML được quản lý toàn phần của AWS cho hình ảnh, giọng nói, văn bản, chatbot và dữ liệu — bạn dùng ngay mà không cần tự xây mô hình.

Nội dung chương

  1. Vì sao AWS có nhiều dịch vụ AI/ML riêng biệt
  2. Amazon Rekognition – nhận diện hình ảnh & video
  3. Amazon Transcribe – chuyển giọng nói thành văn bản
  4. Amazon Polly – chuyển văn bản thành giọng nói
  5. Amazon Translate – dịch ngôn ngữ tự động
  6. Amazon Lex & Amazon Connect – chatbot và contact center
  7. Amazon Comprehend – xử lý ngôn ngữ tự nhiên (NLP)
  8. Amazon SageMaker AI – nền tảng xây dựng mô hình ML
  9. Amazon Kendra – tìm kiếm tài liệu bằng ML
  10. Amazon Personalize – gợi ý cá nhân hóa theo thời gian thực
  11. Amazon Textract – trích xuất dữ liệu từ chứng từ
  12. Phân biệt các dịch vụ dễ nhầm lẫn

1. Vì sao AWS có nhiều dịch vụ AI/ML riêng biệt

Nếu tự xây một hệ thống Machine Learning (ML) từ đầu, bạn phải trải qua rất nhiều bước: thu thập và làm sạch dữ liệu, chọn thuật toán, huấn luyện mô hình trên các máy chủ có GPU, đánh giá độ chính xác, rồi triển khai (deploy) mô hình đó ở quy mô lớn — mỗi bước đều tốn thời gian, cần nhân sự chuyên môn sâu về khoa học dữ liệu. Với phần lớn doanh nghiệp, nhu cầu chỉ đơn giản là "đọc chữ trong ảnh", "biến giọng nói thành văn bản", hay "tìm cảm xúc trong bình luận khách hàng" — những bài toán này đã được giải quyết sẵn và lặp lại ở hàng ngàn công ty khác.

Vì vậy AWS đóng gói các mô hình ML đã huấn luyện sẵn (pre-trained) hoặc nền tảng huấn luyện mô hình thành các dịch vụ managed, để lập trình viên chỉ cần gọi API là có kết quả, không cần biết gì về thuật toán bên trong. Chương này đi qua từng dịch vụ theo loại dữ liệu đầu vào: hình ảnh/video, giọng nói, văn bản, hội thoại, và dữ liệu có cấu trúc — kèm theo dịch vụ nền tảng SageMaker AI cho ai muốn tự xây mô hình.

Lưu ý khi thi: Đề thi CLF-C02 không yêu cầu hiểu thuật toán ML. Bạn chỉ cần nhớ "tên dịch vụ nào giải quyết bài toán nào" — đây là kiểu câu hỏi ghép cặp rất phổ biến.

2. Amazon Rekognition – nhận diện hình ảnh & video

Amazon Rekognition là dịch vụ dùng ML để "nhìn" vào ảnh và video, từ đó tìm ra vật thể, con người, chữ viết, và bối cảnh (scene) xuất hiện trong đó. Bạn có thể hình dung Rekognition như một cặp mắt máy: đưa cho nó một tấm ảnh, nó trả về danh sách những gì nó "thấy" — ví dụ "xe hơi (98% độ tin cậy), đường phố, ban ngày".

Một khả năng đặc biệt của Rekognition là phân tích khuôn mặt (facial analysis) và tìm kiếm khuôn mặt (facial search), phục vụ cho việc xác thực người dùng (user verification) hoặc đếm số người xuất hiện trong một khu vực (people counting). Bạn có thể tạo một "cơ sở dữ liệu khuôn mặt quen thuộc" (collection of familiar faces) — ví dụ danh sách nhân viên công ty — để mỗi khi có ảnh mới, Rekognition so khớp xem người trong ảnh có trùng ai trong danh sách hay không. Nó cũng có thể so sánh khuôn mặt với những người nổi tiếng (celebrity recognition).

Ví dụ thực tế: Một ứng dụng chấm công bằng khuôn mặt tại văn phòng dùng Rekognition: camera chụp ảnh nhân viên khi vào cửa, Rekognition so khớp với "collection" ảnh nhân viên đã đăng ký để xác nhận danh tính và tự động chấm công — không cần quẹt thẻ.

3. Amazon Transcribe – chuyển giọng nói thành văn bản

Amazon Transcribe tự động chuyển đổi giọng nói (audio) thành văn bản (text), dùng một kỹ thuật deep learning gọi là Automatic Speech Recognition (ASR) để chuyển đổi nhanh và chính xác. Bạn có thể tưởng tượng Transcribe như một "người đánh máy" AI, nghe file ghi âm và gõ lại nội dung thành chữ.

Một tính năng hữu ích là Redaction — tự động loại bỏ thông tin cá nhân nhận dạng được (Personally Identifiable Information - PII) khỏi bản transcript, ví dụ số điện thoại, số thẻ tín dụng được khách hàng đọc ra trong cuộc gọi. Transcribe cũng hỗ trợ Automatic Language Identification, tự động nhận diện ngôn ngữ được nói trong file audio đa ngôn ngữ, rất hữu ích khi bạn không biết trước người gọi sẽ nói ngôn ngữ gì.

Lưu ý khi thi: Transcribe = Speech-to-Text (giọng nói → chữ). Đừng nhầm với Polly là Text-to-Speech (chữ → giọng nói), theo chiều ngược lại.

4. Amazon Polly – chuyển văn bản thành giọng nói

Amazon Polly làm ngược lại với Transcribe: nó biến văn bản thành giọng nói tự nhiên, giống người thật (lifelike speech) bằng deep learning. Nhờ Polly, các ứng dụng có thể "nói chuyện" với người dùng — ví dụ ứng dụng đọc tin tức, đọc sách nói, hoặc hệ thống thông báo bằng giọng nói tại nhà ga, sân bay.

Ví dụ thực tế: Một ứng dụng học tiếng Anh dùng Polly để đọc mẫu câu cho học viên nghe với giọng phát âm chuẩn, thay vì phải tự ghi âm hàng ngàn câu.

5. Amazon Translate – dịch ngôn ngữ tự động

Amazon Translate cung cấp dịch thuật ngôn ngữ tự nhiên và chính xác, cho phép bạn địa phương hóa (localize) nội dung website, ứng dụng cho người dùng quốc tế, hoặc dịch một khối lượng lớn văn bản một cách hiệu quả mà không cần thuê dịch giả cho từng ngôn ngữ.

Ví dụ thực tế: Một trang thương mại điện tử bán hàng toàn cầu dùng Translate để tự động dịch mô tả sản phẩm sang hàng chục ngôn ngữ, cập nhật ngay khi nội dung gốc thay đổi.

6. Amazon Lex & Amazon Connect – chatbot và contact center

Amazon Lex

Amazon Lex là công nghệ đứng sau trợ lý ảo Alexa của Amazon. Nó kết hợp hai khả năng: Automatic Speech Recognition (ASR) để chuyển giọng nói thành văn bản, và Natural Language Understanding (NLU) để hiểu được ý định (intent) của người nói hoặc người gõ chữ — ví dụ hiểu rằng câu "Tôi muốn đặt lịch hẹn" có ý định là "Schedule an Appointment". Lex giúp bạn xây dựng chatbot hoặc bot cho trung tâm chăm sóc khách hàng (call center bots) mà không cần tự huấn luyện mô hình NLU từ đầu.

Amazon Connect

Amazon Connect là một trung tâm liên lạc (contact center) chạy trên cloud, cho phép tiếp nhận cuộc gọi và tạo ra các luồng xử lý cuộc gọi (contact flows) — giống một tổng đài ảo. Nó có thể tích hợp với các hệ thống CRM khác hoặc với các dịch vụ AWS khác. Điểm mạnh về chi phí: không cần trả trước (no upfront payments) và rẻ hơn tới 80% so với các giải pháp contact center truyền thống (vốn đòi hỏi đầu tư phần cứng, tổng đài viên vật lý).

Khi kết hợp Lex và Connect, bạn có một luồng xử lý tự động hoàn chỉnh:

  1. Khách hàng gọi điện đến số hotline → cuộc gọi được Amazon Connect tiếp nhận.
  2. Amazon Lex nghe nội dung khách nói và nhận diện ý định, ví dụ "Đặt lịch hẹn".
  3. Lex gọi một hàm AWS Lambda tương ứng với ý định đó.
  4. Lambda gọi vào hệ thống CRM để thực sự đặt lịch hẹn cho khách.

Toàn bộ quá trình diễn ra tự động, không cần nhân viên tổng đài can thiệp cho các yêu cầu đơn giản, lặp lại.

Lưu ý khi thi: Lex = bộ não hiểu ngôn ngữ (chatbot/voicebot); Connect = hạ tầng tổng đài (nhận cuộc gọi, định tuyến). Hai dịch vụ này thường đi kèm nhau trong đề thi.

7. Amazon Comprehend – xử lý ngôn ngữ tự nhiên (NLP)

Amazon Comprehend là dịch vụ cho Natural Language Processing (NLP) — nghĩa là "hiểu" nội dung của văn bản, không chỉ đọc chữ mà đọc được cả ý nghĩa. Đây là dịch vụ fully managed và serverless: bạn không cần quản lý máy chủ, chỉ cần gửi văn bản vào và nhận kết quả phân tích.

Comprehend dùng machine learning để tìm ra insight và mối quan hệ trong văn bản, bao gồm:

Ví dụ thực tế: Một công ty dùng Comprehend để phân tích hàng chục ngàn email phản hồi từ khách hàng, tìm ra những yếu tố nào khiến khách hàng hài lòng hay không hài lòng, và tự động nhóm các bài viết/phản hồi theo chủ đề mà Comprehend phát hiện được, thay vì phải đọc thủ công từng email.
Lưu ý khi thi: Comprehend xử lý và "hiểu" văn bản có sẵn (phân tích cảm xúc, trích xuất thông tin) — khác với Lex là "hiểu ý định trong một cuộc hội thoại" để phản hồi lại người dùng theo thời gian thực.

8. Amazon SageMaker AI – nền tảng xây dựng mô hình ML

Tất cả các dịch vụ ở trên (Rekognition, Transcribe, Polly, Translate, Comprehend...) đều là mô hình ML đã được AWS huấn luyện sẵn cho một bài toán cụ thể. Nhưng nếu bài toán của bạn đặc thù, không nằm trong danh sách có sẵn, bạn cần tự xây mô hình ML của riêng mình — đó là lúc dùng Amazon SageMaker AI.

SageMaker AI là dịch vụ fully managed dành cho developer và data scientist để xây dựng, huấn luyện (train), và triển khai (deploy) mô hình ML. Thông thường, việc thực hiện tất cả các bước này (chuẩn bị dữ liệu, huấn luyện, cấp phát máy chủ, triển khai) một cách riêng lẻ rất khó khăn và mất thời gian; SageMaker gom mọi thứ vào một nền tảng duy nhất.

Một ví dụ đơn giản hóa về quy trình machine learning: giả sử bạn muốn dự đoán điểm thi của học viên dựa trên các yếu tố như số năm kinh nghiệm IT, số năm kinh nghiệm với AWS, và thời gian học khóa học. Quy trình sẽ là:

  1. Dữ liệu lịch sử (Historical Data): thu thập dữ liệu của nhiều học viên trước đó, đã biết điểm số thực tế của họ (dữ liệu có "label").
  2. Xây dựng mô hình ML dựa trên các đặc trưng (features) này.
  3. Huấn luyện và tinh chỉnh (Train and Tune) mô hình để nó dự đoán càng gần thực tế càng tốt.
  4. Áp dụng mô hình vào dữ liệu mới (New data) của một học viên chưa biết kết quả.
  5. Nhận kết quả dự đoán (Prediction) — ví dụ mô hình trả về "PASS WITH 906 score" (dự đoán học viên sẽ đậu với 906 điểm).
Lưu ý khi thi: SageMaker là dịch vụ "nền" (platform) để TỰ xây mô hình ML tùy chỉnh, còn Rekognition/Transcribe/Polly/Translate/Comprehend/Lex/Textract là các mô hình ĐÃ XÂY SẴN cho bài toán cụ thể. Đề thi thường hỏi: "Công ty muốn tự huấn luyện mô hình dự đoán riêng cho ngành của họ" → đáp án là SageMaker.

9. Amazon Kendra – tìm kiếm tài liệu bằng ML

Amazon Kendra là dịch vụ tìm kiếm tài liệu (document search) được ML hỗ trợ toàn phần (fully managed). Khác với công cụ tìm kiếm truyền thống chỉ trả về danh sách tài liệu chứa từ khóa, Kendra có thể trích xuất câu trả lời trực tiếp từ trong tài liệu — bất kể tài liệu đó là văn bản thô, PDF, HTML, PowerPoint, MS Word, hay các trang FAQ.

Kendra hỗ trợ tìm kiếm bằng ngôn ngữ tự nhiên (natural language search) — người dùng có thể hỏi như đang hỏi một con người, ví dụ "Bàn hỗ trợ IT ở đâu?" và Kendra trả lời trực tiếp "Ở tầng 1" thay vì chỉ đưa ra danh sách tài liệu liên quan.

Kendra còn có khả năng học tăng dần (Incremental Learning): nó học từ các tương tác và phản hồi của người dùng để dần ưu tiên hiển thị các kết quả mà người dùng thường chọn. Ngoài ra, quản trị viên có thể tinh chỉnh thủ công kết quả tìm kiếm — ví dụ tăng độ quan trọng của một số dữ liệu, độ mới (freshness), hoặc theo các quy tắc tùy chỉnh khác.

Kendra có thể kết nối và đánh chỉ mục (index) dữ liệu từ nhiều nguồn khác nhau vào một "Knowledge Index" được ML hỗ trợ:

Ví dụ thực tế: Bộ phận nhân sự đưa toàn bộ sổ tay nhân viên (PDF, Word) vào Kendra. Nhân viên mới gõ câu hỏi "Chính sách nghỉ phép năm là gì?" và nhận được câu trả lời trực tiếp trích từ sổ tay, không cần tự đọc và tìm trong file.

10. Amazon Personalize – gợi ý cá nhân hóa theo thời gian thực

Amazon Personalize là dịch vụ ML fully managed giúp xây dựng các ứng dụng có khả năng gợi ý cá nhân hóa theo thời gian thực (real-time personalized recommendations) — chính là công nghệ mà Amazon.com dùng để gợi ý "Sản phẩm bạn có thể thích" cho từng người dùng.

Ví dụ: một khách hàng vừa mua dụng cụ làm vườn (gardening tools) trên một trang thương mại điện tử; Personalize có thể gợi ý ngay món tiếp theo mà khách này nên mua, dựa trên hành vi mua sắm của khách đó và của những khách có hành vi tương tự. Ứng dụng khác của Personalize là xếp hạng lại (re-ranking) danh sách sản phẩm hiển thị, hoặc cá nhân hóa nội dung marketing trực tiếp (customized direct marketing) — ví dụ mỗi khách hàng nhận một email quảng cáo khác nhau, phù hợp với sở thích riêng.

Personalize có thể tích hợp trực tiếp vào website, ứng dụng hiện có, hệ thống SMS, hoặc email marketing đang dùng. Điểm mạnh lớn nhất: bạn có thể triển khai trong vài ngày, không phải vài tháng, vì không cần tự xây, huấn luyện, và triển khai giải pháp ML từ đầu. Các trường hợp sử dụng tiêu biểu: bán lẻ (retail), truyền thông và giải trí (media and entertainment).

Lưu ý khi thi: Personalize dùng cho gợi ý sản phẩm/nội dung cá nhân hóa; đừng nhầm với Kendra (tìm kiếm tài liệu) hay Comprehend (phân tích văn bản) — ba dịch vụ này giải quyết ba bài toán hoàn toàn khác nhau tuy đều là ML.

11. Amazon Textract – trích xuất dữ liệu từ chứng từ

Amazon Textract tự động trích xuất chữ viết (text), chữ viết tay (handwriting), và dữ liệu từ bất kỳ tài liệu được scan nào, sử dụng AI và ML. Khác với việc chỉ "đọc chữ" như Text Detection của Rekognition, Textract hiểu được cấu trúc của tài liệu: nó trích xuất dữ liệu từ các form (biểu mẫu, ví dụ cặp "Tên trường: Giá trị") và từ bảng (table), giữ nguyên mối quan hệ giữa các trường dữ liệu.

Textract có thể đọc và xử lý mọi loại tài liệu (PDF, ảnh scan). Các trường hợp sử dụng tiêu biểu:

Ví dụ thực tế: Đưa một ảnh chụp căn cước công dân vào Textract, dịch vụ trả về dữ liệu có cấu trúc dạng JSON gồm các trường như Document ID, Name, SEX, DOB — sẵn sàng để lưu vào cơ sở dữ liệu, thay vì phải nhập tay từng trường thông tin.
Lưu ý khi thi: Phân biệt Rekognition vs Textract — Rekognition tập trung vào hình ảnh/video nói chung (vật thể, khuôn mặt, cảnh) và chỉ đọc được text đơn giản trong ảnh; Textract chuyên biệt cho CHỨNG TỪ có cấu trúc (form, table, hóa đơn, giấy tờ) và trích xuất dữ liệu có cấu trúc từ đó.

12. Phân biệt các dịch vụ dễ nhầm lẫn

Đề thi CLF-C02 thường đưa ra một tình huống (use case) và yêu cầu chọn đúng dịch vụ. Bảng dưới đây tổng hợp nhanh để tránh nhầm lẫn giữa các dịch vụ có vẻ giống nhau:

Dịch vụĐầu vàoViệc chính nó làm
RekognitionẢnh, videoNhận diện vật thể, khuôn mặt, cảnh, kiểm duyệt nội dung
TextractChứng từ scan (PDF, ảnh)Trích xuất dữ liệu có cấu trúc từ form/table
TranscribeÂm thanh (giọng nói)Chuyển giọng nói → văn bản
PollyVăn bảnChuyển văn bản → giọng nói
TranslateVăn bảnDịch ngôn ngữ
ComprehendVăn bản có sẵnPhân tích cảm xúc, trích key phrase, phân loại chủ đề
LexGiọng nói/chữ hội thoạiHiểu ý định (intent) để xây chatbot/voicebot
ConnectCuộc gọi điện thoạiHạ tầng contact center trên cloud
KendraTài liệu nội bộTìm kiếm và trả lời câu hỏi bằng ngôn ngữ tự nhiên
PersonalizeDữ liệu hành vi người dùngGợi ý cá nhân hóa theo thời gian thực
SageMaker AIDữ liệu tùy chỉnhTự xây, huấn luyện, triển khai mô hình ML riêng

Hai cặp dễ nhầm nhất thường được hỏi trong đề thi là Rekognition vs Textract (ảnh/video tổng quát vs chứng từ có cấu trúc) và Comprehend vs Lex (phân tích văn bản tĩnh có sẵn vs hiểu ý định trong hội thoại thời gian thực để phản hồi lại).

Tổng kết chương

← Chương trước Chương sau →