Tổng quan các dịch vụ AI/ML được quản lý toàn phần của AWS cho hình ảnh, giọng nói, văn bản, chatbot và dữ liệu — bạn dùng ngay mà không cần tự xây mô hình.
Nếu tự xây một hệ thống Machine Learning (ML) từ đầu, bạn phải trải qua rất nhiều bước: thu thập và làm sạch dữ liệu, chọn thuật toán, huấn luyện mô hình trên các máy chủ có GPU, đánh giá độ chính xác, rồi triển khai (deploy) mô hình đó ở quy mô lớn — mỗi bước đều tốn thời gian, cần nhân sự chuyên môn sâu về khoa học dữ liệu. Với phần lớn doanh nghiệp, nhu cầu chỉ đơn giản là "đọc chữ trong ảnh", "biến giọng nói thành văn bản", hay "tìm cảm xúc trong bình luận khách hàng" — những bài toán này đã được giải quyết sẵn và lặp lại ở hàng ngàn công ty khác.
Vì vậy AWS đóng gói các mô hình ML đã huấn luyện sẵn (pre-trained) hoặc nền tảng huấn luyện mô hình thành các dịch vụ managed, để lập trình viên chỉ cần gọi API là có kết quả, không cần biết gì về thuật toán bên trong. Chương này đi qua từng dịch vụ theo loại dữ liệu đầu vào: hình ảnh/video, giọng nói, văn bản, hội thoại, và dữ liệu có cấu trúc — kèm theo dịch vụ nền tảng SageMaker AI cho ai muốn tự xây mô hình.
Amazon Rekognition là dịch vụ dùng ML để "nhìn" vào ảnh và video, từ đó tìm ra vật thể, con người, chữ viết, và bối cảnh (scene) xuất hiện trong đó. Bạn có thể hình dung Rekognition như một cặp mắt máy: đưa cho nó một tấm ảnh, nó trả về danh sách những gì nó "thấy" — ví dụ "xe hơi (98% độ tin cậy), đường phố, ban ngày".
Một khả năng đặc biệt của Rekognition là phân tích khuôn mặt (facial analysis) và tìm kiếm khuôn mặt (facial search), phục vụ cho việc xác thực người dùng (user verification) hoặc đếm số người xuất hiện trong một khu vực (people counting). Bạn có thể tạo một "cơ sở dữ liệu khuôn mặt quen thuộc" (collection of familiar faces) — ví dụ danh sách nhân viên công ty — để mỗi khi có ảnh mới, Rekognition so khớp xem người trong ảnh có trùng ai trong danh sách hay không. Nó cũng có thể so sánh khuôn mặt với những người nổi tiếng (celebrity recognition).
Amazon Transcribe tự động chuyển đổi giọng nói (audio) thành văn bản (text), dùng một kỹ thuật deep learning gọi là Automatic Speech Recognition (ASR) để chuyển đổi nhanh và chính xác. Bạn có thể tưởng tượng Transcribe như một "người đánh máy" AI, nghe file ghi âm và gõ lại nội dung thành chữ.
Một tính năng hữu ích là Redaction — tự động loại bỏ thông tin cá nhân nhận dạng được (Personally Identifiable Information - PII) khỏi bản transcript, ví dụ số điện thoại, số thẻ tín dụng được khách hàng đọc ra trong cuộc gọi. Transcribe cũng hỗ trợ Automatic Language Identification, tự động nhận diện ngôn ngữ được nói trong file audio đa ngôn ngữ, rất hữu ích khi bạn không biết trước người gọi sẽ nói ngôn ngữ gì.
Amazon Polly làm ngược lại với Transcribe: nó biến văn bản thành giọng nói tự nhiên, giống người thật (lifelike speech) bằng deep learning. Nhờ Polly, các ứng dụng có thể "nói chuyện" với người dùng — ví dụ ứng dụng đọc tin tức, đọc sách nói, hoặc hệ thống thông báo bằng giọng nói tại nhà ga, sân bay.
Amazon Translate cung cấp dịch thuật ngôn ngữ tự nhiên và chính xác, cho phép bạn địa phương hóa (localize) nội dung website, ứng dụng cho người dùng quốc tế, hoặc dịch một khối lượng lớn văn bản một cách hiệu quả mà không cần thuê dịch giả cho từng ngôn ngữ.
Amazon Lex là công nghệ đứng sau trợ lý ảo Alexa của Amazon. Nó kết hợp hai khả năng: Automatic Speech Recognition (ASR) để chuyển giọng nói thành văn bản, và Natural Language Understanding (NLU) để hiểu được ý định (intent) của người nói hoặc người gõ chữ — ví dụ hiểu rằng câu "Tôi muốn đặt lịch hẹn" có ý định là "Schedule an Appointment". Lex giúp bạn xây dựng chatbot hoặc bot cho trung tâm chăm sóc khách hàng (call center bots) mà không cần tự huấn luyện mô hình NLU từ đầu.
Amazon Connect là một trung tâm liên lạc (contact center) chạy trên cloud, cho phép tiếp nhận cuộc gọi và tạo ra các luồng xử lý cuộc gọi (contact flows) — giống một tổng đài ảo. Nó có thể tích hợp với các hệ thống CRM khác hoặc với các dịch vụ AWS khác. Điểm mạnh về chi phí: không cần trả trước (no upfront payments) và rẻ hơn tới 80% so với các giải pháp contact center truyền thống (vốn đòi hỏi đầu tư phần cứng, tổng đài viên vật lý).
Khi kết hợp Lex và Connect, bạn có một luồng xử lý tự động hoàn chỉnh:
Toàn bộ quá trình diễn ra tự động, không cần nhân viên tổng đài can thiệp cho các yêu cầu đơn giản, lặp lại.
Amazon Comprehend là dịch vụ cho Natural Language Processing (NLP) — nghĩa là "hiểu" nội dung của văn bản, không chỉ đọc chữ mà đọc được cả ý nghĩa. Đây là dịch vụ fully managed và serverless: bạn không cần quản lý máy chủ, chỉ cần gửi văn bản vào và nhận kết quả phân tích.
Comprehend dùng machine learning để tìm ra insight và mối quan hệ trong văn bản, bao gồm:
Tất cả các dịch vụ ở trên (Rekognition, Transcribe, Polly, Translate, Comprehend...) đều là mô hình ML đã được AWS huấn luyện sẵn cho một bài toán cụ thể. Nhưng nếu bài toán của bạn đặc thù, không nằm trong danh sách có sẵn, bạn cần tự xây mô hình ML của riêng mình — đó là lúc dùng Amazon SageMaker AI.
SageMaker AI là dịch vụ fully managed dành cho developer và data scientist để xây dựng, huấn luyện (train), và triển khai (deploy) mô hình ML. Thông thường, việc thực hiện tất cả các bước này (chuẩn bị dữ liệu, huấn luyện, cấp phát máy chủ, triển khai) một cách riêng lẻ rất khó khăn và mất thời gian; SageMaker gom mọi thứ vào một nền tảng duy nhất.
Một ví dụ đơn giản hóa về quy trình machine learning: giả sử bạn muốn dự đoán điểm thi của học viên dựa trên các yếu tố như số năm kinh nghiệm IT, số năm kinh nghiệm với AWS, và thời gian học khóa học. Quy trình sẽ là:
Amazon Kendra là dịch vụ tìm kiếm tài liệu (document search) được ML hỗ trợ toàn phần (fully managed). Khác với công cụ tìm kiếm truyền thống chỉ trả về danh sách tài liệu chứa từ khóa, Kendra có thể trích xuất câu trả lời trực tiếp từ trong tài liệu — bất kể tài liệu đó là văn bản thô, PDF, HTML, PowerPoint, MS Word, hay các trang FAQ.
Kendra hỗ trợ tìm kiếm bằng ngôn ngữ tự nhiên (natural language search) — người dùng có thể hỏi như đang hỏi một con người, ví dụ "Bàn hỗ trợ IT ở đâu?" và Kendra trả lời trực tiếp "Ở tầng 1" thay vì chỉ đưa ra danh sách tài liệu liên quan.
Kendra còn có khả năng học tăng dần (Incremental Learning): nó học từ các tương tác và phản hồi của người dùng để dần ưu tiên hiển thị các kết quả mà người dùng thường chọn. Ngoài ra, quản trị viên có thể tinh chỉnh thủ công kết quả tìm kiếm — ví dụ tăng độ quan trọng của một số dữ liệu, độ mới (freshness), hoặc theo các quy tắc tùy chỉnh khác.
Kendra có thể kết nối và đánh chỉ mục (index) dữ liệu từ nhiều nguồn khác nhau vào một "Knowledge Index" được ML hỗ trợ:
Amazon Personalize là dịch vụ ML fully managed giúp xây dựng các ứng dụng có khả năng gợi ý cá nhân hóa theo thời gian thực (real-time personalized recommendations) — chính là công nghệ mà Amazon.com dùng để gợi ý "Sản phẩm bạn có thể thích" cho từng người dùng.
Ví dụ: một khách hàng vừa mua dụng cụ làm vườn (gardening tools) trên một trang thương mại điện tử; Personalize có thể gợi ý ngay món tiếp theo mà khách này nên mua, dựa trên hành vi mua sắm của khách đó và của những khách có hành vi tương tự. Ứng dụng khác của Personalize là xếp hạng lại (re-ranking) danh sách sản phẩm hiển thị, hoặc cá nhân hóa nội dung marketing trực tiếp (customized direct marketing) — ví dụ mỗi khách hàng nhận một email quảng cáo khác nhau, phù hợp với sở thích riêng.
Personalize có thể tích hợp trực tiếp vào website, ứng dụng hiện có, hệ thống SMS, hoặc email marketing đang dùng. Điểm mạnh lớn nhất: bạn có thể triển khai trong vài ngày, không phải vài tháng, vì không cần tự xây, huấn luyện, và triển khai giải pháp ML từ đầu. Các trường hợp sử dụng tiêu biểu: bán lẻ (retail), truyền thông và giải trí (media and entertainment).
Amazon Textract tự động trích xuất chữ viết (text), chữ viết tay (handwriting), và dữ liệu từ bất kỳ tài liệu được scan nào, sử dụng AI và ML. Khác với việc chỉ "đọc chữ" như Text Detection của Rekognition, Textract hiểu được cấu trúc của tài liệu: nó trích xuất dữ liệu từ các form (biểu mẫu, ví dụ cặp "Tên trường: Giá trị") và từ bảng (table), giữ nguyên mối quan hệ giữa các trường dữ liệu.
Textract có thể đọc và xử lý mọi loại tài liệu (PDF, ảnh scan). Các trường hợp sử dụng tiêu biểu:
Đề thi CLF-C02 thường đưa ra một tình huống (use case) và yêu cầu chọn đúng dịch vụ. Bảng dưới đây tổng hợp nhanh để tránh nhầm lẫn giữa các dịch vụ có vẻ giống nhau:
| Dịch vụ | Đầu vào | Việc chính nó làm |
|---|---|---|
| Rekognition | Ảnh, video | Nhận diện vật thể, khuôn mặt, cảnh, kiểm duyệt nội dung |
| Textract | Chứng từ scan (PDF, ảnh) | Trích xuất dữ liệu có cấu trúc từ form/table |
| Transcribe | Âm thanh (giọng nói) | Chuyển giọng nói → văn bản |
| Polly | Văn bản | Chuyển văn bản → giọng nói |
| Translate | Văn bản | Dịch ngôn ngữ |
| Comprehend | Văn bản có sẵn | Phân tích cảm xúc, trích key phrase, phân loại chủ đề |
| Lex | Giọng nói/chữ hội thoại | Hiểu ý định (intent) để xây chatbot/voicebot |
| Connect | Cuộc gọi điện thoại | Hạ tầng contact center trên cloud |
| Kendra | Tài liệu nội bộ | Tìm kiếm và trả lời câu hỏi bằng ngôn ngữ tự nhiên |
| Personalize | Dữ liệu hành vi người dùng | Gợi ý cá nhân hóa theo thời gian thực |
| SageMaker AI | Dữ liệu tùy chỉnh | Tự xây, huấn luyện, triển khai mô hình ML riêng |
Hai cặp dễ nhầm nhất thường được hỏi trong đề thi là Rekognition vs Textract (ảnh/video tổng quát vs chứng từ có cấu trúc) và Comprehend vs Lex (phân tích văn bản tĩnh có sẵn vs hiểu ý định trong hội thoại thời gian thực để phản hồi lại).