#Topic
1

Giới thiệu Vision Language Model

Mục tiêu

Hiểu VLM là gì và tại sao OCR đang chuyển dịch sang VLM.

Nội dung

  • Evolution:

    • Computer Vision

    • OCR

    • Multimodal AI

    • VLM

  • Vision Encoder

  • Language Model

  • Multimodal Alignment

  • Contrastive Learning

Mô hình

  • CLIP

  • BLIP-2

Lab

  • Image Retrieval

  • Zero-shot Classification

2

Kiến trúc của Modern VLM

Nội dung

  • Vision Transformer (ViT)

  • Patch Embedding

  • Cross Attention

  • Q-Former

  • Projector

Mô hình

  • LLaVA

  • Qwen2.5-VL

Lab: Xây dựng mô hình VLM bằng tay

3

Nền tảng OCR

OCR hoạt động thế nào?

  • Detection

  • Recognition

  • Post-processing

  • CER

  • WER

Mô hình

  • Tesseract OCR

  • PaddleOCR

  • VietOCR

Lab

OCR tiếng Việt

4

Mô hình OCR bằng Transformer

Buổi 4. OCR bằng Transformer

Nội dung

OCR hiện đại

  • CRNN

  • Transformer OCR

  • Seq2Seq OCR

Mô hình

  • TrOCR

  • VietOCR

Lab

Fine-tuning OCR

5

Document OCR

Nội dung

OCR không chỉ đọc chữ.

Phải hiểu:

  • Layout

  • Reading Order

  • Bounding Box

  • Table

Mô hình

  • Surya OCR

  • DocLayout-YOLO

Lab

Xây dựng model detect layout

6

OCR thế hệ mới với VLM

Nội dung

Từ OCR sang OCR-Free

Mô hình

  • Chandra OCR

  • Qwen2.5-VL

Chủ đề

  • OCR-Free Extraction

  • Visual Grounding

  • End-to-End Extraction

Lab

Xây dựng model chuyển Hóa đơn thành JSON

7

OCR tập trung vào văn bản Tiếng Việt

Nội dung

Các mô hình cho tiếng Việt.

Mô hình

  • Vintern

  • Qwen2.5-VL

Lab: Xây dựng model nhận diện

  • CCCD

  • Hóa đơn

  • Giấy phép kinh doanh

  • Hợp đồng

8

OCR trong hệ thống Chatbot

Chủ đề

  • OCR Pipeline

  • Table RAG

  • Graph RAG

  • Agent đọc tài liệu

  • Multi-document QA

9

Dự án cuối khóa - Xây dựng OCR mã nguồn mở cho Tiếng Việt

  • Dựa trên các dữ liệu mở + dữ liệu cung cấp của ProtonX

Tiến hành đào tạo mô hình AI open source có chất lượng cao