Agent Mode

Agent Mode là chế độ hội thoại trên Trạm AI Chat, trong đó model không chỉ trả lời một lượt mà tự lặp vòng plan → act → check: phân tích yêu cầu, quyết định gọi tool nào, chạy tool, đọc kết quả, rồi lặp lại cho tới khi hoàn thành tác vụ hoặc báo lý do không làm được.

Ở chế độ chat thông thường, mỗi tin nhắn là một lần gọi model duy nhất: một request, một câu trả lời bằng văn bản. Model không thể tự tạo ảnh, không tự xuất file, không tự chạy thêm bước nào.

Agent Mode khác gì chat thông thường

Chat thông thườngAgent Mode
Vòng xử lý1 request → 1 câu trả lờiNhiều bước: model → tool → model → …
ToolKhông cóTạo ảnh, video, giọng nói, xuất tài liệu, đóng gói website
Kết quả trả vềVăn bản (và ảnh nếu model hỗ trợ multimodal)Văn bản, ảnh, video, file âm thanh, PDF, .zip, artifact xem trước
Chọn modelToàn bộ danh mục model của Trạm AIDanh sách model điều phối (orchestrator) đã tuyển chọn
System promptKhông có sẵnCó sẵn prompt điều phối
Chi phí1 lần gọi gateway mỗi tin nhắnN lần gọi gateway — mỗi bước và mỗi tool đều tính phí
Tốc độNhanhChậm hơn, tỉ lệ thuận với số bước

Cả hai chế độ đều chạy trên cùng một API key sk-* của người dùng và cùng trừ vào số dư VND của tài khoản. Agent Mode không cần cấu hình gì thêm ngoài việc bật công tắc.

Những tool có sẵn trong Agent Mode

Khi bật Agent Mode, model được cấp sẵn các tool sau — người dùng không cần khai báo gì, chỉ cần mô tả yêu cầu bằng ngôn ngữ tự nhiên:

ToolCông dụngKết quả trong hội thoại
image_genTạo ảnh từ mô tả văn bảnẢnh hiển thị inline, tải về được
video_genTạo video/clip ngắn từ mô tảVideo phát ngay trong hội thoại
audio_genĐọc văn bản thành giọng nói (TTS)File âm thanh có trình phát
save_documentĐóng gói tài liệu đã soạnFile Markdown + PDF đính kèm
save_websiteĐóng gói website nhiều fileFile .zip kèm bản xem trước trực tiếp
ArtifactsHiển thị code, HTML, biểu đồ MermaidKhung xem trước cạnh hội thoại
ContextĐọc file người dùng đính kèmẢnh, PDF và audio được đưa vào ngữ cảnh

Model nào hỗ trợ Agent Mode

Không phải model nào cũng làm orchestrator được. Model phải hỗ trợ function calling, tool choice, system message, streaming và có context window đủ lớn (tối thiểu 32k, khuyến nghị từ 128k) để chứa lịch sử hội thoại cộng với kết quả tool qua nhiều vòng lặp.

Danh sách model đang phục vụ Agent Mode trên chat.tramlabs.io:

ModelSlugThế mạnh
Gemini 3.1 Progemini-3.1-pro-previewNhanh, context window lớn — hợp với tài liệu dài và bài toán lập kế hoạch phức tạp
GPT-5.5gpt-5.5Cân bằng tốc độ và chất lượng — mạnh về code, phân tích dữ liệu, suy luận có cấu trúc
Claude Sonnet 4.6claude-sonnet-4.6Suy luận kỹ và chi tiết — hợp với viết lách, phân tích, tác vụ nhiều sắc thái
DeepSeek V4 Flashdeepseek-v4-flashNhanh, chi phí thấp — mạnh về sinh code và tác vụ hằng ngày
Qwen 3.5 Plusqwen-3.5-plusĐa ngôn ngữ tốt — mạnh tiếng Trung, code và suy luận toán
MiniMax M3minimax-m3Gọn nhẹ, hiệu quả — cân bằng tốc độ/chất lượng với chi phí thấp

Khi bật Agent Mode lần đầu, hệ thống chọn sẵn Gemini 3.1 Pro. Người dùng có thể đổi sang model khác bất cứ lúc nào bằng trình chọn model ở đầu hội thoại.

DeepSeek V4 Flash không hỗ trợ đọc ảnh. Nếu đính kèm ảnh khi đang dùng model này, kết quả sẽ sai hoặc request thất bại — hãy chuyển sang model có vision như Gemini 3.1 Pro, GPT-5.5 hoặc Claude Sonnet 4.6.

Các model dùng để tạo nội dung media là một danh sách riêng, tách khỏi model điều phối:

  • Ảnh — GPT Image 2, Gemini 3 Pro Image Preview, Gemini 3.1 Flash Image Preview, Gemini 2.5 Flash Image
  • Video — Veo 3.1, Seedance 2.0, Seedance 2.0 Fast, Seedance 2.0 Mini
  • Giọng nói — ElevenLabs v3, ElevenLabs Flash v2.5, GPT-4o mini TTS

Cách bật và sử dụng trên chat.tramlabs.io

1

Đăng nhập

Truy cập chat.tramlabs.io và đăng nhập bằng tài khoản Trạm AI. Tài khoản cần có số dư VND — nạp tại console.tramlabs.io.

2

Bật Agent mode

Bật Agent mode ở góc phải thanh tiêu đề hội thoại. Một hộp thoại xác nhận sẽ hiện ra, nhắc rằng ở chế độ này chỉ cần chọn một model duy nhất và hệ thống lo phần còn lại, đổi lại chi phí mỗi request cao hơn chế độ thường. Chọn để tiếp tục.

3

Chọn model

Sau khi bật, danh sách model chỉ hiển thị nhóm Agent Mode với các model trong bảng phía trên. Danh mục model thường tạm thời được ẩn để tránh chọn nhầm model không sử dụng agent.

4

Mô tả yêu cầu

Nhắn yêu cầu bằng ngôn ngữ tự nhiên. Không cần gọi tên tool — model tự quyết định khi nào cần tạo ảnh, xuất PDF hay đóng gói website. Có thể đính kèm ảnh, PDF hoặc file âm thanh vào tin nhắn.

5

Chọn model media khi được hỏi

Khi yêu cầu tạo ảnh/video/giọng nói mà chưa nêu rõ model, một thẻ chọn model hiện ngay phía trên ô nhập. Bấm vào lựa chọn mong muốn — hoặc dùng phím số 14, phím mũi tên và Enter khi con trỏ không nằm trong ô nhập. Lựa chọn này được ghim cho cả hội thoại; nếu lần tạo đó thất bại, thẻ sẽ hiện lại để đổi sang model khác.

6

Tắt Agent mode

Tắt Agent mode để quay lại chat thông thường và danh mục model đầy đủ. Chế độ được ghi nhớ theo từng hội thoại, và hội thoại mới sẽ mở ở chế độ mà người dùng chọn gần nhất.

Ví dụ use case

“Tổng hợp các quy định mới về hóa đơn điện tử trong file PDF đính kèm, so sánh với quy định cũ, rồi xuất thành một tài liệu có mục lục.”

Agent đọc PDF qua ngữ cảnh, phân tích và soạn nội dung, sau đó gọi save_document để đính kèm bản Markdown và PDF vào hội thoại — người dùng tải về là dùng được ngay.

“Viết bài blog giới thiệu sản phẩm mới, tạo một ảnh bìa minh họa và một đoạn voice-over đọc phần mở đầu.”

Agent viết bài trước, gọi image_gen để tạo ảnh bìa, rồi gọi audio_gen để dựng file âm thanh — cả ba kết quả nằm trong cùng một lượt trả lời, không cần chuyển qua lại giữa nhiều công cụ.

“Dựng landing page một trang cho quán cà phê, có phần menu và form liên hệ.”

Agent sinh mã HTML/CSS/JS, hiển thị bản xem trước trực tiếp, rồi gọi save_website để đóng gói toàn bộ file thành .zip. Bản xem trước hiển thị một trang; site nhiều trang vẫn nằm đủ trong file .zip.

“Đọc bảng số liệu trong ảnh này, tính tăng trưởng theo quý và vẽ sơ đồ luồng quy trình.”

Agent đọc ảnh (với model có vision), tính toán, rồi kết xuất biểu đồ Mermaid dưới dạng artifact xem được ngay cạnh hội thoại.

“Tạo 4 phiên bản ảnh quảng cáo cho chiến dịch Tết với cùng thông điệp nhưng khác bố cục.”

Agent gọi image_gen nhiều lần trong cùng một lượt, giữ nguyên ngữ cảnh thông điệp giữa các lần tạo.

Giới hạn và lưu ý

Chi phí

Đây là khác biệt quan trọng nhất so với chat thường. Mỗi bước trong vòng lặp là một lần gọi độc lập và đều trừ vào số dư VND: bước model suy luận, bước gọi tool tạo ảnh, bước model đọc kết quả rồi trả lời… Một yêu cầu nhìn có vẻ đơn giản vẫn có thể phát sinh nhiều lần tính phí.

Ngoài ra, ngữ cảnh phình dần qua từng vòng lặp — kết quả tool được đưa ngược vào prompt — nên chi phí input token cũng tăng theo số bước. Hãy theo dõi mức tiêu thụ tại console.tramlabs.io.

Nếu số dư cạn giữa chừng, gateway trả về lỗi 402 và agent dừng ngay tại bước đang chạy. Những bước đã hoàn thành trước đó vẫn bị tính phí. Hãy đảm bảo đủ số dư trước khi giao tác vụ dài.

Giới hạn kỹ thuật

  • Số bước tối đa: mỗi lượt trả lời có giới hạn số bước. Tác vụ quá dài nên chia thành nhiều tin nhắn thay vì gói vào một yêu cầu duy nhất.
  • Thời gian phản hồi: lâu hơn chat thường vì phải chờ tool chạy xong (đặc biệt là tạo video).
  • Tool chưa có: Agent Mode hiện không có tìm kiếm web, không có code interpreter và không có tìm kiếm trên kho tài liệu (RAG). Model chỉ làm việc với kiến thức sẵn có cộng với file người dùng đính kèm trong hội thoại.
  • Không tự tạo agent riêng: trình dựng agent (Agent Builder) đang tắt trên chat.tramlabs.io. Danh sách model điều phối và bộ tool là cấu hình cố định phía hệ thống.
  • Model media bị ghim: sau khi chọn model tạo ảnh/video/giọng nói, lựa chọn đó áp dụng cho cả hội thoại. Muốn đổi, hãy nêu rõ tên model trong yêu cầu hoặc mở hội thoại mới.

Lưu ý khi sử dụng

  • Mô tả rõ kết quả mong muốn. Agent quyết định gọi tool dựa trên yêu cầu; câu lệnh mơ hồ dễ khiến nó trả lời bằng văn bản thay vì tạo file. Nói thẳng “xuất ra PDF”, “tạo ảnh”, “đóng gói thành zip” sẽ chắc chắn hơn.
  • Không dùng Agent Mode cho hỏi đáp đơn giản. Với câu hỏi một lượt, chat thường vừa nhanh vừa rẻ hơn đáng kể.
  • Kiểm tra kết quả tool. Model có thể diễn giải sai kết quả trả về từ tool; với nội dung quan trọng, hãy mở file đính kèm ra kiểm tra.
  • Gemini 3.1 Pro là bản preview — hành vi gọi tool có thể thay đổi giữa các phiên bản API.

Câu hỏi thường gặp

Không. Agent Mode áp dụng cho hội thoại hiện tại và giữ nguyên lịch sử tin nhắn. Chế độ được ghi nhớ theo từng hội thoại, nên mở lại một hội thoại cũ sẽ thấy đúng chế độ lúc trước.

Không. Agent Mode dùng chính API key sk-* mà tài khoản đã được cấp khi đăng nhập Trạm AI Chat. Mọi lượt gọi model và mọi lần chạy tool đều đi qua gateway trên key đó và trừ vào cùng một số dư VND.

Hiện chưa. Agent Mode là tính năng của giao diện chat.tramlabs.io. Nếu cần dựng agent trong ứng dụng riêng, xem hướng dẫn Tool Calling.

Khi Agent Mode đang bật, danh sách model chỉ hiển thị nhóm Agent Mode.

Ảnh, video, file âm thanh, PDF và .zip được đính kèm vào hội thoại và lưu trong mục My Files của tài khoản, tải về bất cứ lúc nào.