Multimodal

Trạm AI hỗ trợ nhiều định dạng dữ liệu (modality) input và output ngoài văn bản. Người dùng có thể gửi hình ảnh, PDF, audio và video tới các model tương thích, hoặc tạo giọng nói từ văn bản. Tất cả đều thông qua một API hợp nhất, giúp xây dựng những tương tác multimodal phong phú cho nhiều tình huống sử dụng khác nhau.

Các modality hỗ trợ

Hình ảnh

Gửi hình ảnh tới các model có khả năng xử lý thị giác (vision) để phân tích, mô tả, nhận diện ký tự (OCR) và nhiều tác vụ khác. Trạm AI hỗ trợ nhiều định dạng ảnh, cả ảnh dạng URL lẫn ảnh mã hóa base64.

Tìm hiểu thêm về image input →

Tạo hình ảnh

Tạo hình ảnh từ text prompt bằng các model AI có khả năng xuất hình ảnh. Trạm AI hỗ trợ nhiều model tạo ảnh, dựng nên hình ảnh chất lượng cao dựa trên mô tả của người dùng.

Tìm hiểu thêm về tạo hình ảnh →

PDF

Xử lý tài liệu PDF với bất kỳ model nào trên Trạm AI. Hệ thống phân tách PDF thông minh (parsing) sẽ tự động trích xuất văn bản, xử lý được cả tài liệu dạng text lẫn tài liệu scan.

Tìm hiểu thêm về xử lý PDF →

Audio

Gửi file audio tới các model có khả năng xử lý giọng nói để chuyển chữ (transcribe), phân tích và xử lý, hoặc nhận lại response dạng audio từ các model có khả năng xuất audio. Trạm AI hỗ trợ các định dạng audio phổ biến cho cả input và output.

Tìm hiểu thêm về audio →

Video

Gửi file video tới các model có khả năng xử lý video để phân tích, mô tả, phát hiện vật thể và nhận diện hành động. Trạm AI hỗ trợ nhiều định dạng video phục vụ các tác vụ hiểu video toàn diện.

Tìm hiểu thêm về video input →

Tạo video

Tạo video từ text prompt bằng các model AI có khả năng xuất video. Trạm AI cung cấp API tạo video bất đồng bộ (asynchronous), cho phép tùy chỉnh độ phân giải, tỷ lệ khung hình, thời lượng và ảnh tham chiếu tùy chọn.

Tìm hiểu thêm về tạo video →

Text-to-Speech

Tạo audio giọng nói từ văn bản qua một endpoint riêng, tương thích với OpenAI. Trạm AI hỗ trợ nhiều provider và nhiều giọng đọc khác nhau với đầu ra định dạng MP3 hoặc PCM.

Tìm hiểu thêm về text-to-speech →

Speech-to-Text

Chuyển audio thành văn bản qua một endpoint riêng. Trạm AI hỗ trợ nhiều provider và model STT, trả về JSON có cấu trúc gồm văn bản đã chuyển chữ (transcribe) cùng số liệu thống kê sử dụng.

Tìm hiểu thêm về speech-to-text →

Bắt đầu sử dụng

Phần lớn input multimodal đều dùng chung endpoint /v1/chat/completions với tham số messages. Các loại nội dung khác nhau sẽ được chỉ định rõ trong danh sách content của message:

  • Hình ảnh: Dùng content type image_url
  • PDF: Dùng content type file kèm dữ liệu PDF
  • Audio: Dùng content type input_audio
  • Video: Dùng content type video_url

Người dùng có thể kết hợp nhiều modality trong cùng một request; số file gửi được sẽ tùy theo từng provider và model.

Text-to-Speech dùng một endpoint riêng tại /v1/audio/speech. Xem tài liệu TTS để biết chi tiết.

Speech-to-Text dùng một endpoint riêng tại /v1/audio/transcriptions. Xem tài liệu STT để biết chi tiết.

Tính tương thích của model

Không phải model nào cũng hỗ trợ tất cả các định dạng dữ liệu (modality). Trạm AI tự động lọc các model khả dụng dựa theo nội dung request:

  • Vision model: Cần có để xử lý hình ảnh
  • Model tương thích file: Xử lý PDF trực tiếp (native) hoặc thông qua hệ thống phân tích của chúng tôi
  • Model hỗ trợ audio: Cần có để xử lý audio đầu vào
  • Model hỗ trợ video: Cần có để xử lý video đầu vào

Dùng trang Models để tìm các model hỗ trợ những modality đầu vào cần thiết.

Hỗ trợ định dạng đầu vào

Với input multimodal, Trạm AI hỗ trợ cả URL trực tiếp lẫn dữ liệu mã hóa base64:

URL (khuyến nghị cho nội dung công khai)

  • Hình ảnh: https://example.com/image.jpg
  • PDF: https://example.com/document.pdf
  • Audio: Không hỗ trợ qua URL (chỉ base64)
  • Video: Tùy provider (ví dụ link YouTube cho Gemini trên AI Studio)

Mã hóa Base64 (bắt buộc cho file cục bộ)

  • Hình ảnh: data:image/jpeg;base64,{base64_data}
  • PDF: data:application/pdf;base64,{base64_data}
  • Audio: Chuỗi base64 thô kèm khai báo định dạng
  • Video: data:video/mp4;base64,{base64_data}

Với file lớn, dùng URL hiệu quả hơn vì không cần mã hóa cục bộ và giúp giảm kích thước payload của request. Mã hóa base64 là bắt buộc với file cục bộ hoặc khi nội dung không truy cập công khai được.

Lưu ý về video URL: Khả năng hỗ trợ video URL tùy theo từng provider. Ví dụ, Google Gemini trên AI Studio chỉ hỗ trợ link YouTube. Xem tài liệu về video input để biết chi tiết theo từng provider.

Câu hỏi thường gặp

Được! Bạn có thể gửi văn bản, hình ảnh, PDF, audio và video trong cùng một request. Model sẽ xử lý tất cả đầu vào này cùng lúc.

  • Hình ảnh: Thường tính theo mỗi ảnh hoặc theo input token
  • PDF: Trích xuất văn bản miễn phí, xử lý OCR tính phí, hoặc theo giá của model
  • Audio đầu vào: Tính theo input token dựa trên thời lượng
  • Audio đầu ra: Tính theo completion token
  • Video: Tính theo input token dựa trên thời lượng và độ phân giải

Khả năng hỗ trợ video tùy theo từng model. Dùng trang Models để lọc các model hỗ trợ video. Kiểm tra tài liệu của từng model để biết giới hạn cụ thể về định dạng và thời lượng video.

Tạo video dùng một API bất đồng bộ tại /v1/videos. Bạn gửi prompt, nhận về một job ID, rồi poll cho đến khi video sẵn sàng tải về. Xem tài liệu tạo video để biết chi tiết.

Text-to-speech dùng một endpoint riêng tại /v1/audio/speech. Bạn gửi văn bản và nhận về một luồng byte audio thô. Endpoint này tương thích với OpenAI Audio Speech API, nên bạn có thể dùng các thư viện client của OpenAI. Xem tài liệu TTS để biết chi tiết.

Speech-to-text dùng một endpoint riêng tại /v1/audio/transcriptions. Bạn gửi audio mã hóa base64 và nhận về response JSON gồm văn bản đã transcribe và thống kê mức sử dụng. Xem tài liệu STT để biết chi tiết.