Audio
Trạm AI hỗ trợ cả việc gửi file audio đến các model tương thích lẫn nhận response audio qua API. Hướng dẫn này trình bày cách làm việc với audio đầu vào và audio đầu ra.
Audio đầu vào
Người dùng có thể gửi file audio đến các model tương thích để transcribe, phân tích và xử lý. Request audio đầu vào dùng API /v1/chat/completions với content type input_audio. File audio phải được mã hóa base64 và kèm theo phần khai báo định dạng.
Lưu ý: File audio phải được mã hóa base64 - URL trực tiếp không được hỗ trợ cho nội dung audio.
Người dùng có thể tìm model hỗ trợ audio đầu vào bằng cách lọc theo modality audio đầu vào trên trang Models.
Gửi file audio
Dưới đây là cách gửi một file audio để xử lý:
Các định dạng audio đầu vào hỗ trợ
Các định dạng audio được hỗ trợ sẽ khác nhau tùy provider. Một số định dạng phổ biến gồm:
wav- WAV audiomp3- MP3 audioaiff- AIFF audioaac- AAC audioogg- OGG Vorbis audioflac- FLAC audiom4a- M4A audiopcm16- PCM16 audiopcm24- PCM24 audio
Lưu ý: Hãy kiểm tra tài liệu của model để biết chính xác model đó hỗ trợ những định dạng audio nào. Không phải model nào cũng hỗ trợ tất cả định dạng.
Audio đầu ra
Trạm AI hỗ trợ nhận response audio từ các model có khả năng tạo audio đầu ra. Để yêu cầu audio đầu ra, chỉ cần thêm hai tham số modalities và audio vào request.
Người dùng có thể tìm các model hỗ trợ audio đầu ra bằng cách lọc theo modality audio đầu ra trên trang Models.
Yêu cầu audio đầu ra
Để nhận audio đầu ra, hãy đặt modalities thành ["text", "audio"] và cung cấp cấu hình audio với giọng nói cùng định dạng mong muốn:
Định dạng chunk khi streaming
Audio đầu ra yêu cầu phải bật streaming (stream: true). Dữ liệu audio và transcript đều được gửi về theo từng phần qua trường delta.audio trong mỗi chunk:
Các tùy chọn cấu hình audio
Tham số audio chấp nhận những tùy chọn sau: