Machine Learning trên AWS
1. Chương này gồm những gì
Phần tiêu đề “1. Chương này gồm những gì”Phần Machine Learning của bộ slide là một vòng điểm danh: mỗi dịch vụ một slide, và một slide cuối rút gọn mỗi dịch vụ thành đúng một dòng. Hãy đọc nó như một bài ghép cặp — với mỗi dịch vụ, ghi nhớ đúng loại bài toán mà nó giải.
Thứ tự dưới đây là thứ tự của chính bộ slide: Rekognition, Transcribe, Polly, Translate, Lex và Connect, Comprehend (kèm Comprehend Medical), SageMaker AI, Kendra, Personalize và Textract.
Toàn bộ các dịch vụ trong chương này đều là dịch vụ managed (được AWS quản lý): bạn gọi API, AWS lo mô hình và hạ tầng bên dưới. Ngoại lệ duy nhất là Amazon SageMaker AI, nơi bạn thực sự tự xây và huấn luyện mô hình của mình.
2. Amazon Rekognition — phân tích ảnh và video
Phần tiêu đề “2. Amazon Rekognition — phân tích ảnh và video”Amazon Rekognition dùng ML để tìm object, người, chữ viết và bối cảnh (scene) trong ảnh và video. Nó cũng làm được phân tích khuôn mặt (facial analysis) và tìm kiếm theo khuôn mặt (facial search) để phục vụ việc xác minh người dùng (user verification) hoặc đếm số người trong khung hình. Bạn có thể tạo một cơ sở dữ liệu các “familiar faces” (khuôn mặt quen) của riêng mình, hoặc so sánh với tập người nổi tiếng (celebrities) do AWS cung cấp.
Các use case tiêu biểu mà slide liệt kê:
- Labeling — tự động gắn nhãn nội dung ảnh/video.
- Content Moderation — kiểm duyệt nội dung (xem chi tiết ngay bên dưới).
- Text Detection — nhận diện chữ trong ảnh.
- Face Detection and Analysis — nhận diện và phân tích khuôn mặt (giới tính, khoảng tuổi, cảm xúc…).
- Face Search and Verification — tìm kiếm và xác minh theo khuôn mặt.
- Celebrity Recognition — nhận diện người nổi tiếng.
- Pathing — theo dõi đường di chuyển của đối tượng, ví dụ phân tích một trận đấu thể thao.
Content Moderation
Phần tiêu đề “Content Moderation”Đây là tính năng đủ quan trọng để slide dành riêng một trang. Rekognition Content Moderation phát hiện nội dung không phù hợp, không mong muốn hoặc mang tính xúc phạm (inappropriate, unwanted, or offensive) trong cả ảnh và video. Nó được dùng nhiều trong mạng xã hội, truyền thông phát sóng (broadcast media), quảng cáo và thương mại điện tử để tạo môi trường an toàn hơn cho người dùng, đồng thời giúp doanh nghiệp tuân thủ quy định (comply with regulations).
Luồng xử lý theo diagram của slide gồm ba bước: ảnh đi vào Amazon Rekognition, Rekognition trả về một Confidence Level (mức độ tin cậy) so với ngưỡng bạn đặt, và nội dung bị gắn cờ có thể chuyển sang bước review thủ công (không bắt buộc).
- Bạn tự đặt Minimum Confidence Threshold — ngưỡng tin cậy tối thiểu để một nội dung bị gắn cờ.
- Nội dung nhạy cảm bị gắn cờ có thể đưa sang Amazon Augmented AI (A2I) để con người xem lại thủ công.
3. Amazon Transcribe — giọng nói thành chữ
Phần tiêu đề “3. Amazon Transcribe — giọng nói thành chữ”Amazon Transcribe tự động chuyển giọng nói thành văn bản (speech to text). Bên dưới nó dùng một quy trình deep learning gọi là automatic speech recognition (ASR) để chuyển đổi nhanh và chính xác.
Hai tính năng đáng nhớ:
- Redaction — tự động loại bỏ Personally Identifiable Information (PII), tức thông tin nhận dạng cá nhân, khỏi bản ghi văn bản.
- Automatic Language Identification — tự nhận diện ngôn ngữ, phục vụ các file audio đa ngôn ngữ (multi-lingual audio).
Use case theo slide:
- Chuyển nội dung cuộc gọi chăm sóc khách hàng thành văn bản.
- Tự động tạo closed captioning và subtitling (phụ đề).
- Sinh metadata cho tài sản media để tạo một kho lưu trữ có thể tìm kiếm toàn văn.
4. Amazon Polly — chữ thành giọng nói
Phần tiêu đề “4. Amazon Polly — chữ thành giọng nói”Amazon Polly làm điều ngược lại Transcribe: biến văn bản thành giọng nói giống người thật (lifelike speech) bằng deep learning, cho phép bạn xây các ứng dụng “biết nói”.
Lexicon & SSML
Phần tiêu đề “Lexicon & SSML”Polly có hai cơ chế để bạn kiểm soát cách đọc:
- Pronunciation lexicons — tùy biến cách phát âm của từ. Slide nêu hai ví dụ: từ viết cách điệu (
St3ph4neđọc thành “Stephane”) và từ viết tắt (AWSđọc thành “Amazon Web Services”). Bạn upload lexicon rồi dùng nó trong lệnh SynthesizeSpeech. - Speech Synthesis Markup Language (SSML) — Polly sinh giọng nói từ văn bản thuần, hoặc từ tài liệu có markup SSML để tùy biến sâu hơn: nhấn mạnh từ/cụm từ, phát âm theo phiên âm (phonetic pronunciation), thêm tiếng hít thở hoặc giọng thì thầm, và dùng kiểu đọc Newscaster (giọng phát thanh viên).
5. Amazon Translate — dịch ngôn ngữ
Phần tiêu đề “5. Amazon Translate — dịch ngôn ngữ”Amazon Translate cung cấp bản dịch tự nhiên và chính xác giữa các ngôn ngữ. Mục đích chính là localize (bản địa hóa) nội dung — website, ứng dụng — cho người dùng quốc tế, và dịch khối lượng văn bản lớn một cách hiệu quả.
6. Amazon Lex & Amazon Connect — chatbot và tổng đài
Phần tiêu đề “6. Amazon Lex & Amazon Connect — chatbot và tổng đài”Hai dịch vụ này đi cùng nhau trong slide vì chúng thường được ghép thành một giải pháp tổng đài thông minh.
Amazon Lex dùng đúng công nghệ đứng sau Alexa:
- Automatic Speech Recognition (ASR) để chuyển giọng nói thành văn bản.
- Natural Language Understanding để nhận ra intent (ý định) của đoạn văn bản hay của người gọi.
- Dùng để xây chatbot và call center bot.
Amazon Connect là phần tổng đài:
- Nhận cuộc gọi, tạo contact flow (luồng xử lý cuộc gọi) — một trung tâm liên lạc ảo (virtual contact center) chạy trên cloud.
- Tích hợp được với các hệ thống CRM khác hoặc với các dịch vụ AWS.
- Không cần trả trước (no upfront payments), và rẻ hơn 80% so với các giải pháp contact center truyền thống.
Diagram của slide mô tả một luồng hoàn chỉnh: cuộc gọi điện thoại đi vào Connect, Connect đẩy luồng âm thanh (call stream) sang Lex, Lex nhận ra intent (ví dụ “đặt lịch hẹn” – Schedule an Appointment), rồi gọi (invoke) một Lambda function, và Lambda ghi lịch hẹn vào hệ thống CRM.
7. Amazon Comprehend — xử lý ngôn ngữ tự nhiên
Phần tiêu đề “7. Amazon Comprehend — xử lý ngôn ngữ tự nhiên”Amazon Comprehend là dịch vụ Natural Language Processing (NLP — xử lý ngôn ngữ tự nhiên), fully managed và serverless. Nó dùng machine learning để tìm ra insight và quan hệ trong văn bản:
- Nhận biết ngôn ngữ của văn bản.
- Trích xuất key phrase (cụm từ khóa), địa điểm, người, thương hiệu, sự kiện.
- Hiểu văn bản mang sắc thái tích cực hay tiêu cực (sentiment).
- Phân tích văn bản qua tokenization và parts of speech (từ loại).
- Tự động nhóm một tập file văn bản theo chủ đề (topic).
Hai use case mẫu trong slide: phân tích tương tác với khách hàng (ví dụ email) để tìm ra điều gì dẫn tới trải nghiệm tích cực hay tiêu cực; và tạo/nhóm các bài viết theo chủ đề mà Comprehend tự phát hiện ra.
Amazon Comprehend Medical
Phần tiêu đề “Amazon Comprehend Medical”Biến thể chuyên cho y tế: Amazon Comprehend Medical phát hiện và trả về thông tin hữu ích trong văn bản y khoa phi cấu trúc (unstructured clinical text) — ghi chú của bác sĩ (physician’s notes), bản tóm tắt ra viện (discharge summaries), kết quả xét nghiệm (test results), ghi chú ca bệnh (case notes).
- Dùng NLP để phát hiện Protected Health Information (PHI) — thông tin sức khỏe được bảo vệ — qua API DetectPHI.
- Cách đưa dữ liệu vào theo slide: lưu tài liệu trong Amazon S3, phân tích dữ liệu real-time bằng Kinesis Data Firehose, hoặc dùng Amazon Transcribe để chuyển lời kể của bệnh nhân thành văn bản rồi cho Comprehend Medical phân tích.
8. Amazon SageMaker AI — tự xây mô hình
Phần tiêu đề “8. Amazon SageMaker AI — tự xây mô hình”Amazon SageMaker AI là dịch vụ fully managed dành cho developer / data scientist để xây mô hình ML của chính mình. Lý do nó tồn tại: bình thường rất khó làm toàn bộ các bước của quy trình ML ở cùng một chỗ, lại còn phải tự provision server.
Slide minh họa quy trình ML (đã đơn giản hóa) bằng bài toán dự đoán điểm thi:
| Bước | Nội dung |
|---|---|
| Dữ liệu lịch sử (historical data) | Số năm kinh nghiệm IT, số năm kinh nghiệm với AWS, thời gian đã học… kèm label là điểm thi thực tế (ví dụ 670, 890, 934) |
| Build | Xây ML model từ dữ liệu đó |
| Train and Tune | Huấn luyện và tinh chỉnh mô hình |
| Apply model | Đưa dữ liệu mới vào mô hình |
| Prediction | Nhận kết quả dự đoán (ví dụ: PASS WITH 906) |
9. Amazon Kendra — tìm kiếm tài liệu bằng ML
Phần tiêu đề “9. Amazon Kendra — tìm kiếm tài liệu bằng ML”Amazon Kendra là dịch vụ tìm kiếm tài liệu fully managed, chạy bằng Machine Learning. Khác với tìm kiếm theo từ khóa thông thường, Kendra trích xuất câu trả lời từ bên trong tài liệu — text, PDF, HTML, PowerPoint, MS Word, FAQ…
- Hỗ trợ tìm kiếm theo ngôn ngữ tự nhiên (natural language search).
- Incremental Learning — học từ tương tác/phản hồi của người dùng để đẩy các kết quả được ưa thích lên trước.
- Cho phép tinh chỉnh thủ công kết quả tìm kiếm (theo độ quan trọng của nguồn dữ liệu, độ mới — freshness, hoặc tiêu chí tùy chỉnh).
Theo diagram, Kendra gom dữ liệu (indexing) từ nhiều Data Source: Amazon S3, Amazon RDS, Google Drive, MS SharePoint, MS OneDrive, cùng các nguồn thứ ba, APN và nguồn tùy chỉnh. Tất cả được đẩy vào một Knowledge Index do ML điều khiển. Người dùng hỏi bằng câu tự nhiên (“Where is the IT support desk?”) và nhận về câu trả lời trực tiếp (“1st floor”) thay vì một danh sách link.
10. Amazon Personalize — gợi ý cá nhân hóa real-time
Phần tiêu đề “10. Amazon Personalize — gợi ý cá nhân hóa real-time”Amazon Personalize là dịch vụ ML fully managed để xây ứng dụng có gợi ý cá nhân hóa theo thời gian thực (real-time personalized recommendations). Đây chính là công nghệ mà Amazon.com đang dùng.
- Ví dụ ứng dụng: gợi ý sản phẩm cá nhân hóa hoặc re-rank danh sách sản phẩm, làm marketing trực tiếp (direct marketing) theo từng người.
- Ví dụ cụ thể trong slide: người dùng vừa mua dụng cụ làm vườn → gợi ý món tiếp theo nên mua.
- Tích hợp vào website, ứng dụng, SMS, hệ thống email marketing đang có.
- Triển khai trong vài ngày, không phải vài tháng — bạn không phải tự build, train và deploy giải pháp ML.
- Use case: cửa hàng bán lẻ, truyền thông và giải trí…
Diagram mô tả: Amazon Personalize đọc dữ liệu từ Amazon S3 và nhận thêm dữ liệu real-time qua Amazon Personalize API, rồi phơi ra một API cá nhân hóa để website, mobile app, SMS và email cùng gọi.
11. Amazon Textract — trích xuất dữ liệu từ tài liệu scan
Phần tiêu đề “11. Amazon Textract — trích xuất dữ liệu từ tài liệu scan”Amazon Textract tự động trích xuất chữ, chữ viết tay (handwriting) và dữ liệu từ mọi tài liệu đã scan bằng AI và ML.
- Lấy được dữ liệu từ form và table (biểu mẫu và bảng), không chỉ đọc chữ trơn.
- Đọc và xử lý được mọi loại tài liệu: PDF, ảnh…
- Kết quả trả về ở dạng dữ liệu có cấu trúc. Ví dụ trong slide, Textract phân tích một giấy tờ tùy thân và trả về các cặp khóa–giá trị:
{ "Document ID": "123456789-005", "Name": "", "SEX": "F", "DOB": "23.05.1997"}Use case theo slide:
- Financial Services — hóa đơn, báo cáo tài chính.
- Healthcare — hồ sơ y tế, yêu cầu bảo hiểm (insurance claims).
- Public Sector — tờ khai thuế, giấy tờ tùy thân, hộ chiếu.
Tóm tắt nhanh
Phần tiêu đề “Tóm tắt nhanh”| Dịch vụ | Dùng để làm gì |
|---|---|
| Rekognition | Nhận diện khuôn mặt, gắn nhãn (labeling), nhận diện người nổi tiếng trong ảnh/video |
| Transcribe | Audio → text (ví dụ tạo phụ đề) |
| Polly | Text → audio |
| Translate | Dịch ngôn ngữ |
| Lex | Xây bot hội thoại — chatbot |
| Connect | Contact center trên cloud |
| Comprehend | Xử lý ngôn ngữ tự nhiên (NLP); bản Medical phát hiện PHI |
| SageMaker AI | Machine learning cho mọi developer và data scientist — tự build/train mô hình |
| Kendra | Search engine chạy bằng ML |
| Personalize | Gợi ý cá nhân hóa real-time |
| Textract | Phát hiện chữ và dữ liệu trong tài liệu |