Machine Learning trên AWS
1. Vì sao có nhiều dịch vụ AI/ML
Phần tiêu đề “1. Vì sao có nhiều dịch vụ AI/ML”Nếu tự xây một hệ thống Machine Learning (ML) từ đầu, bạn phải trải qua rất nhiều bước: thu thập và làm sạch dữ liệu, chọn thuật toán, huấn luyện mô hình trên các máy chủ có GPU, đánh giá độ chính xác, rồi triển khai (deploy) mô hình đó ở quy mô lớn — mỗi bước đều tốn thời gian, cần nhân sự chuyên môn sâu về khoa học dữ liệu. Với phần lớn doanh nghiệp, nhu cầu chỉ đơn giản là “đọc chữ trong ảnh”, “biến giọng nói thành văn bản”, hay “tìm cảm xúc trong bình luận khách hàng” — những bài toán này đã được giải quyết sẵn và lặp lại ở hàng ngàn công ty khác.
Vì vậy AWS đóng gói các mô hình ML đã huấn luyện sẵn (pre-trained) hoặc nền tảng huấn luyện mô hình thành các dịch vụ managed, để lập trình viên chỉ cần gọi API là có kết quả, không cần biết gì về thuật toán bên trong. Chương này đi qua từng dịch vụ theo loại dữ liệu đầu vào: hình ảnh/video, giọng nói, văn bản, hội thoại, và dữ liệu có cấu trúc — kèm theo dịch vụ nền tảng SageMaker AI cho ai muốn tự xây mô hình.
2. Amazon Rekognition
Phần tiêu đề “2. Amazon Rekognition”Amazon Rekognition là dịch vụ dùng ML để “nhìn” vào ảnh và video, từ đó tìm ra vật thể, con người, chữ viết, và bối cảnh (scene) xuất hiện trong đó. Bạn có thể hình dung Rekognition như một cặp mắt máy: đưa cho nó một tấm ảnh, nó trả về danh sách những gì nó “thấy” — ví dụ “xe hơi (98% độ tin cậy), đường phố, ban ngày”.
Một khả năng đặc biệt của Rekognition là phân tích khuôn mặt (facial analysis) và tìm kiếm khuôn mặt (facial search), phục vụ cho việc xác thực người dùng (user verification) hoặc đếm số người xuất hiện trong một khu vực (people counting). Bạn có thể tạo một “cơ sở dữ liệu khuôn mặt quen thuộc” (collection of familiar faces) — ví dụ danh sách nhân viên công ty — để mỗi khi có ảnh mới, Rekognition so khớp xem người trong ảnh có trùng ai trong danh sách hay không. Nó cũng có thể so sánh khuôn mặt với những người nổi tiếng (celebrity recognition).
- Labeling: gán nhãn cho vật thể, cảnh vật trong ảnh/video.
- Content Moderation: tự động phát hiện nội dung không phù hợp (bạo lực, khiêu dâm…) trước khi cho người dùng đăng tải.
- Text Detection: đọc chữ xuất hiện trong ảnh (ví dụ biển số xe, băng rôn).
- Face Detection and Analysis: phát hiện khuôn mặt và ước lượng đặc điểm như giới tính, độ tuổi, cảm xúc.
- Face Search and Verification: tìm và xác thực khuôn mặt trong một tập dữ liệu đã biết trước.
- Celebrity Recognition: nhận diện người nổi tiếng xuất hiện trong ảnh/video.
- Pathing: theo dõi đường di chuyển của một đối tượng qua nhiều khung hình video, ví dụ phân tích đường chạy của vận động viên trong một trận thể thao.
3. Amazon Transcribe
Phần tiêu đề “3. Amazon Transcribe”Amazon Transcribe tự động chuyển đổi giọng nói (audio) thành văn bản (text), dùng một kỹ thuật deep learning gọi là Automatic Speech Recognition (ASR) để chuyển đổi nhanh và chính xác. Bạn có thể tưởng tượng Transcribe như một “người đánh máy” AI, nghe file ghi âm và gõ lại nội dung thành chữ.
Một tính năng hữu ích là Redaction — tự động loại bỏ thông tin cá nhân nhận dạng được (Personally Identifiable Information - PII) khỏi bản transcript, ví dụ số điện thoại, số thẻ tín dụng được khách hàng đọc ra trong cuộc gọi. Transcribe cũng hỗ trợ Automatic Language Identification, tự động nhận diện ngôn ngữ được nói trong file audio đa ngôn ngữ, rất hữu ích khi bạn không biết trước người gọi sẽ nói ngôn ngữ gì.
- Chuyển đổi (transcribe) các cuộc gọi dịch vụ khách hàng thành văn bản để phân tích chất lượng.
- Tự động tạo phụ đề ẩn (closed captioning) và phụ đề (subtitling) cho video.
- Sinh metadata cho các tài sản media (media assets) để tạo một kho lưu trữ có thể tìm kiếm đầy đủ (fully searchable archive).
4. Amazon Polly
Phần tiêu đề “4. Amazon Polly”Amazon Polly làm ngược lại với Transcribe: nó biến văn bản thành giọng nói tự nhiên, giống người thật (lifelike speech) bằng deep learning. Nhờ Polly, các ứng dụng có thể “nói chuyện” với người dùng — ví dụ ứng dụng đọc tin tức, đọc sách nói, hoặc hệ thống thông báo bằng giọng nói tại nhà ga, sân bay.
5. Amazon Translate
Phần tiêu đề “5. Amazon Translate”Amazon Translate cung cấp dịch thuật ngôn ngữ tự nhiên và chính xác, cho phép bạn địa phương hóa (localize) nội dung website, ứng dụng cho người dùng quốc tế, hoặc dịch một khối lượng lớn văn bản một cách hiệu quả mà không cần thuê dịch giả cho từng ngôn ngữ.
6. Amazon Lex & Connect
Phần tiêu đề “6. Amazon Lex & Connect”Amazon Lex
Phần tiêu đề “Amazon Lex”Amazon Lex là công nghệ đứng sau trợ lý ảo Alexa của Amazon. Nó kết hợp hai khả năng: Automatic Speech Recognition (ASR) để chuyển giọng nói thành văn bản, và Natural Language Understanding (NLU) để hiểu được ý định (intent) của người nói hoặc người gõ chữ — ví dụ hiểu rằng câu “Tôi muốn đặt lịch hẹn” có ý định là “Schedule an Appointment”. Lex giúp bạn xây dựng chatbot hoặc bot cho trung tâm chăm sóc khách hàng (call center bots) mà không cần tự huấn luyện mô hình NLU từ đầu.
Amazon Connect
Phần tiêu đề “Amazon Connect”Amazon Connect là một trung tâm liên lạc (contact center) chạy trên cloud, cho phép tiếp nhận cuộc gọi và tạo ra các luồng xử lý cuộc gọi (contact flows) — giống một tổng đài ảo. Nó có thể tích hợp với các hệ thống CRM khác hoặc với các dịch vụ AWS khác. Điểm mạnh về chi phí: không cần trả trước (no upfront payments) và rẻ hơn tới 80% so với các giải pháp contact center truyền thống (vốn đòi hỏi đầu tư phần cứng, tổng đài viên vật lý).
Khi kết hợp Lex và Connect, bạn có một luồng xử lý tự động hoàn chỉnh:
- Khách hàng gọi điện đến số hotline → cuộc gọi được Amazon Connect tiếp nhận.
- Amazon Lex nghe nội dung khách nói và nhận diện ý định, ví dụ “Đặt lịch hẹn”.
- Lex gọi một hàm AWS Lambda tương ứng với ý định đó.
- Lambda gọi vào hệ thống CRM để thực sự đặt lịch hẹn cho khách.
Toàn bộ quá trình diễn ra tự động, không cần nhân viên tổng đài can thiệp cho các yêu cầu đơn giản, lặp lại.
7. Amazon Comprehend (NLP)
Phần tiêu đề “7. Amazon Comprehend (NLP)”Amazon Comprehend là dịch vụ cho Natural Language Processing (NLP) — nghĩa là “hiểu” nội dung của văn bản, không chỉ đọc chữ mà đọc được cả ý nghĩa. Đây là dịch vụ fully managed và serverless: bạn không cần quản lý máy chủ, chỉ cần gửi văn bản vào và nhận kết quả phân tích.
Comprehend dùng machine learning để tìm ra insight và mối quan hệ trong văn bản, bao gồm:
- Nhận diện ngôn ngữ của đoạn văn bản.
- Trích xuất các cụm từ khóa (key phrases), địa điểm, con người, thương hiệu (brands), sự kiện được đề cập.
- Hiểu được văn bản mang tính tích cực hay tiêu cực đến mức nào (phân tích cảm xúc - sentiment analysis).
- Phân tích văn bản bằng token hóa (tokenization) và xác định từ loại (parts of speech) — ví dụ từ nào là danh từ, động từ.
- Tự động sắp xếp một tập hợp file văn bản theo chủ đề (topic modeling).
8. Amazon SageMaker AI
Phần tiêu đề “8. Amazon SageMaker AI”Tất cả các dịch vụ ở trên (Rekognition, Transcribe, Polly, Translate, Comprehend…) đều là mô hình ML đã được AWS huấn luyện sẵn cho một bài toán cụ thể. Nhưng nếu bài toán của bạn đặc thù, không nằm trong danh sách có sẵn, bạn cần tự xây mô hình ML của riêng mình — đó là lúc dùng Amazon SageMaker AI.
SageMaker AI là dịch vụ fully managed dành cho developer và data scientist để xây dựng, huấn luyện (train), và triển khai (deploy) mô hình ML. Thông thường, việc thực hiện tất cả các bước này (chuẩn bị dữ liệu, huấn luyện, cấp phát máy chủ, triển khai) một cách riêng lẻ rất khó khăn và mất thời gian; SageMaker gom mọi thứ vào một nền tảng duy nhất.
Một ví dụ đơn giản hóa về quy trình machine learning: giả sử bạn muốn dự đoán điểm thi của học viên dựa trên các yếu tố như số năm kinh nghiệm IT, số năm kinh nghiệm với AWS, và thời gian học khóa học. Quy trình sẽ là:
- Dữ liệu lịch sử (Historical Data): thu thập dữ liệu của nhiều học viên trước đó, đã biết điểm số thực tế của họ (dữ liệu có “label”).
- Xây dựng mô hình ML dựa trên các đặc trưng (features) này.
- Huấn luyện và tinh chỉnh (Train and Tune) mô hình để nó dự đoán càng gần thực tế càng tốt.
- Áp dụng mô hình vào dữ liệu mới (New data) của một học viên chưa biết kết quả.
- Nhận kết quả dự đoán (Prediction) — ví dụ mô hình trả về “PASS WITH 906 score” (dự đoán học viên sẽ đậu với 906 điểm).
9. Amazon Kendra
Phần tiêu đề “9. Amazon Kendra”Amazon Kendra là dịch vụ tìm kiếm tài liệu (document search) được ML hỗ trợ toàn phần (fully managed). Khác với công cụ tìm kiếm truyền thống chỉ trả về danh sách tài liệu chứa từ khóa, Kendra có thể trích xuất câu trả lời trực tiếp từ trong tài liệu — bất kể tài liệu đó là văn bản thô, PDF, HTML, PowerPoint, MS Word, hay các trang FAQ.
Kendra hỗ trợ tìm kiếm bằng ngôn ngữ tự nhiên (natural language search) — người dùng có thể hỏi như đang hỏi một con người, ví dụ “Bàn hỗ trợ IT ở đâu?” và Kendra trả lời trực tiếp “Ở tầng 1” thay vì chỉ đưa ra danh sách tài liệu liên quan.
Kendra còn có khả năng học tăng dần (Incremental Learning): nó học từ các tương tác và phản hồi của người dùng để dần ưu tiên hiển thị các kết quả mà người dùng thường chọn. Ngoài ra, quản trị viên có thể tinh chỉnh thủ công kết quả tìm kiếm — ví dụ tăng độ quan trọng của một số dữ liệu, độ mới (freshness), hoặc theo các quy tắc tùy chỉnh khác.
Kendra có thể kết nối và đánh chỉ mục (index) dữ liệu từ nhiều nguồn khác nhau vào một “Knowledge Index” được ML hỗ trợ:
- Amazon S3, Amazon RDS.
- Google Drive, Microsoft SharePoint, Microsoft OneDrive.
- Các nguồn của bên thứ ba, AWS Partner Network (APN), hoặc nguồn tùy chỉnh (custom) qua API.
10. Amazon Personalize
Phần tiêu đề “10. Amazon Personalize”Amazon Personalize là dịch vụ ML fully managed giúp xây dựng các ứng dụng có khả năng gợi ý cá nhân hóa theo thời gian thực (real-time personalized recommendations) — chính là công nghệ mà Amazon.com dùng để gợi ý “Sản phẩm bạn có thể thích” cho từng người dùng.
Ví dụ: một khách hàng vừa mua dụng cụ làm vườn (gardening tools) trên một trang thương mại điện tử; Personalize có thể gợi ý ngay món tiếp theo mà khách này nên mua, dựa trên hành vi mua sắm của khách đó và của những khách có hành vi tương tự. Ứng dụng khác của Personalize là xếp hạng lại (re-ranking) danh sách sản phẩm hiển thị, hoặc cá nhân hóa nội dung marketing trực tiếp (customized direct marketing) — ví dụ mỗi khách hàng nhận một email quảng cáo khác nhau, phù hợp với sở thích riêng.
Personalize có thể tích hợp trực tiếp vào website, ứng dụng hiện có, hệ thống SMS, hoặc email marketing đang dùng. Điểm mạnh lớn nhất: bạn có thể triển khai trong vài ngày, không phải vài tháng, vì không cần tự xây, huấn luyện, và triển khai giải pháp ML từ đầu. Các trường hợp sử dụng tiêu biểu: bán lẻ (retail), truyền thông và giải trí (media and entertainment).
11. Amazon Textract
Phần tiêu đề “11. Amazon Textract”Amazon Textract tự động trích xuất chữ viết (text), chữ viết tay (handwriting), và dữ liệu từ bất kỳ tài liệu được scan nào, sử dụng AI và ML. Khác với việc chỉ “đọc chữ” như Text Detection của Rekognition, Textract hiểu được cấu trúc của tài liệu: nó trích xuất dữ liệu từ các form (biểu mẫu, ví dụ cặp “Tên trường: Giá trị”) và từ bảng (table), giữ nguyên mối quan hệ giữa các trường dữ liệu.
Textract có thể đọc và xử lý mọi loại tài liệu (PDF, ảnh scan). Các trường hợp sử dụng tiêu biểu:
- Dịch vụ tài chính: hóa đơn (invoices), báo cáo tài chính (financial reports).
- Y tế: hồ sơ bệnh án (medical records), hồ sơ bảo hiểm (insurance claims).
- Khu vực công: mẫu khai thuế (tax forms), giấy tờ tùy thân (ID documents), hộ chiếu (passports).
12. Phân biệt dịch vụ dễ nhầm
Phần tiêu đề “12. Phân biệt dịch vụ dễ nhầm”Đề thi CLF-C02 thường đưa ra một tình huống (use case) và yêu cầu chọn đúng dịch vụ. Bảng dưới đây tổng hợp nhanh để tránh nhầm lẫn giữa các dịch vụ có vẻ giống nhau:
| Dịch vụ | Đầu vào | Việc chính nó làm |
|---|---|---|
| Rekognition | Ảnh, video | Nhận diện vật thể, khuôn mặt, cảnh, kiểm duyệt nội dung |
| Textract | Chứng từ scan (PDF, ảnh) | Trích xuất dữ liệu có cấu trúc từ form/table |
| Transcribe | Âm thanh (giọng nói) | Chuyển giọng nói → văn bản |
| Polly | Văn bản | Chuyển văn bản → giọng nói |
| Translate | Văn bản | Dịch ngôn ngữ |
| Comprehend | Văn bản có sẵn | Phân tích cảm xúc, trích key phrase, phân loại chủ đề |
| Lex | Giọng nói/chữ hội thoại | Hiểu ý định (intent) để xây chatbot/voicebot |
| Connect | Cuộc gọi điện thoại | Hạ tầng contact center trên cloud |
| Kendra | Tài liệu nội bộ | Tìm kiếm và trả lời câu hỏi bằng ngôn ngữ tự nhiên |
| Personalize | Dữ liệu hành vi người dùng | Gợi ý cá nhân hóa theo thời gian thực |
| SageMaker AI | Dữ liệu tùy chỉnh | Tự xây, huấn luyện, triển khai mô hình ML riêng |
Hai cặp dễ nhầm nhất thường được hỏi trong đề thi là Rekognition vs Textract (ảnh/video tổng quát vs chứng từ có cấu trúc) và Comprehend vs Lex (phân tích văn bản tĩnh có sẵn vs hiểu ý định trong hội thoại thời gian thực để phản hồi lại).
Tổng kết chương
Phần tiêu đề “Tổng kết chương”- Amazon Rekognition: nhận diện vật thể, khuôn mặt, chữ trong ảnh/video; kiểm duyệt nội dung; nhận diện người nổi tiếng.
- Amazon Transcribe: chuyển audio thành văn bản (speech-to-text), hỗ trợ redaction PII và tự nhận diện ngôn ngữ.
- Amazon Polly: chuyển văn bản thành giọng nói tự nhiên (text-to-speech).
- Amazon Translate: dịch ngôn ngữ tự động, chính xác, ở quy mô lớn.
- Amazon Lex: công nghệ nền của Alexa — hiểu ý định để xây chatbot, voicebot.
- Amazon Connect: trung tâm liên lạc (contact center) trên cloud, rẻ hơn 80% so với giải pháp truyền thống.
- Amazon Comprehend: NLP — phân tích cảm xúc, trích xuất key phrase, phân loại chủ đề trong văn bản.
- Amazon SageMaker AI: nền tảng fully managed để xây, huấn luyện và triển khai mô hình ML tùy chỉnh.
- Amazon Kendra: công cụ tìm kiếm tài liệu bằng ML, trả lời trực tiếp câu hỏi ngôn ngữ tự nhiên.
- Amazon Personalize: gợi ý cá nhân hóa thời gian thực, cùng công nghệ với Amazon.com.
- Amazon Textract: trích xuất dữ liệu có cấu trúc (form, table) từ chứng từ scan.