
Nếu bạn đang tìm cách ghép Hermes Agent ChatGPT — tức là cho Hermes chạy bằng gói ChatGPT bạn đã trả tiền hằng tháng thay vì mua API theo token — thì câu trả lời ngắn là: được. Trong menu hermes model có sẵn lựa chọn «ChatGPT or Codex Subscription» (đăng nhập OAuth, dùng các model Codex). Nhưng có hai điều phải biết trước: tài liệu Hermes nói rõ gói nào đủ điều kiện và Hermes trừ hạn mức thế nào hiện chưa được ghi lại, và một lượt nhờ việc của agent có thể gọi model nhiều lần nên hạn mức hết nhanh hơn bạn tưởng.
Bài này tôi đi qua đủ các đường: gói ChatGPT, gói Claude, OpenRouter, Nous Portal và model tự chạy — cái nào hợp với ai, giới hạn ở đâu, và đặt dự phòng thế nào để con bot không đứng việc giữa giờ làm.
Hermes Agent dùng model nào và trả tiền theo cách nào?
Hermes không tự có model. Nó là phần vỏ agent, còn «bộ não» thì bạn cắm vào từ bên ngoài theo một trong ba kiểu:
- API key, trả theo token: bạn dán khoá của OpenAI, Anthropic, OpenRouter… vào, dùng bao nhiêu trả bấy nhiêu.
- Đăng nhập gói thuê bao bằng OAuth: ChatGPT/Codex, Claude Max, Nous Portal. Không cần khoá API, Hermes mượn quyền của tài khoản bạn đã trả tiền.
- Model tự chạy qua endpoint tuỳ chỉnh: Ollama, LM Studio hay một máy chủ model nội bộ của công ty.
Hai lưu ý chung quan trọng hơn mọi so sánh giá:
- Agent tốn hơn chat thường rất nhiều. Bạn hỏi một câu, nhưng agent có thể gọi model chục lần: đọc công cụ, chạy lệnh, đọc kết quả, nén ngữ cảnh, gọi model phụ để tóm tắt trang web. Đừng lấy cảm giác «mình chat ChatGPT cả ngày không hết hạn mức» để ước lượng.
- Model phải có ngữ cảnh tối thiểu 64.000 token theo yêu cầu trong tài liệu khởi động nhanh của Hermes. Model nhỏ hơn sẽ gãy giữa chừng.
Nếu bạn chưa cài Hermes, nên xem trước bài cài Hermes Agent trên Windows, Ubuntu và macOS rồi quay lại phần chọn model này.

Hermes agent ChatGPT Plus: dùng gói ChatGPT qua openai-codex
Đây là đường phổ biến nhất với người đã trả tiền ChatGPT hằng tháng. Cách làm: chạy hermes model, chọn mục «ChatGPT or Codex Subscription» — mô tả trong tài liệu ghi là ChatGPT OAuth, dùng các model Codex.
Theo tài liệu nhà cung cấp của Hermes, luồng đăng nhập này mặc định dùng device code: màn hình hiện một đường link và một mã, bạn mở link trên điện thoại hay máy tính bất kỳ, nhập mã, xong. Thông tin đăng nhập được lưu ở ~/.hermes/auth.json. Nếu máy bạn đã đăng nhập Codex CLI từ trước, Hermes có thể lấy lại từ ~/.codex/auth.json thay vì bắt đăng nhập lại.
Phần phải đọc kỹ — giới hạn. Tài liệu Hermes viết nguyên văn rằng «gói ChatGPT nào đủ điều kiện, và mức dùng của Hermes được tính vào hạn mức Codex của gói ra sao, hiện chưa được ghi trong tài liệu». Nghĩa là không ai hứa với bạn điều gì cả. Còn theo trang giá Codex của OpenAI tại thời điểm tôi kiểm (04/10/2026): tin nhắn ở máy cá nhân và phiên trên đám mây dùng chung hạn mức của gói, tính theo cửa sổ 5 giờ và có thể kèm giới hạn theo tuần; người dùng Plus và Pro khi chạm trần có thể mua thêm credits. Giá credits thì bạn kiểm tra trang chính thức của OpenAI, tôi không trích con số.
Hệ quả thực tế cho doanh nghiệp: một công ty phân phối vật tư xây dựng đặt cron cho Hermes chạy 6 lần/ngày để tổng hợp đơn chưa giao và gửi về nhóm Zalo nội bộ, cộng thêm 5–7 nhân viên kho hỏi bot qua Telegram — chừng đó đã đủ ăn hạn mức trong cửa sổ 5 giờ. Khi hết, agent sẽ báo lỗi cho tới lúc hạn mức hồi lại. Nếu bạn định cho cả phòng dùng chung một tài khoản, hãy chuẩn bị sẵn phương án dự phòng ở phần cuối bài.
Trải nghiệm của tôi: cả 4 profile Hermes tôi đang chạy đều dùng provider openai-codex, tức là đăng nhập bằng gói ChatGPT chứ không trả API theo token. Với nhịp dùng của tôi thì đường này đủ, và cái hay là hoá đơn cố định — không có chuyện sáng mai mở ra thấy bill lạ.
Hermes agent codex oauth trên máy chủ không có trình duyệt
Chạy Hermes trên VPS thì đăng nhập kiểu nào? Dùng mặc định là ổn — device code không cần trình duyệt trên chính máy đó, cũng không cần dựng tunnel. Bạn SSH vào VPS, chạy lệnh, lấy mã, mở link bằng điện thoại.
Chỉ khi tổ chức của bạn tắt luồng device code thì mới phải chuyển sang luồng trình duyệt: hermes auth add openai-codex --browser, hoặc đặt auth.codex_login_flow: browser trong cấu hình. Lúc đó Hermes lắng nghe ở http://localhost:1455/auth/callback, nên bạn phải tunnel cổng 1455 từ máy cá nhân sang VPS thì trình duyệt mới gọi về được. Chi tiết môi trường máy chủ tôi có nói kỹ hơn trong bài Hermes Agent VPS: cấu hình tối thiểu, chạy Docker và bật 24/7 an toàn.
Hermes agent Claude subscription: dùng gói Claude được không?
Câu trả lời ngắn: khó hơn ChatGPT nhiều, và gói Claude Pro thì không. Theo trang tài liệu nhà cung cấp của Hermes, đường OAuth với Anthropic «chỉ chạy nếu bạn đang ở gói Claude Max và đã mua thêm extra usage credits»; Hermes chỉ trừ vào phần credits mua thêm đó, không trừ vào hạn mức gốc của gói Max. Tài liệu cũng ghi thẳng: người dùng Claude Pro không dùng được đường này.
Thay thế duy nhất được nêu là biến môi trường ANTHROPIC_API_KEY — trả theo token, không liên quan tới gói thuê bao.
Có một điểm mâu thuẫn tôi thấy cần nói thẳng: trang hướng dẫn «OAuth over SSH» của chính Hermes lại liệt kê anthropic (Claude Pro/Max) trong danh sách nhà cung cấp dùng luồng dán mã. Hai trang không khớp nhau. Hermes Agent đổi rất nhanh, nên lời khuyên của tôi là: trước khi mua gì, kiểm tra lại trang tài liệu chính thức và điều khoản của Anthropic tại đúng thời điểm bạn đọc, đừng mua gói Max chỉ vì một bài blog (kể cả bài này) nói là dùng được.
Bạn có thể đọc thêm tại trang nhà cung cấp model của Hermes Agent — đây là nguồn tôi dùng cho toàn bộ phần lệnh trong bài.
Hermes agent OpenRouter free models: chạy thử không tốn tiền
Muốn thử Hermes mà chưa muốn trả đồng nào thì OpenRouter là đường dễ nhất. Có hai cách kết nối: đặt OPENROUTER_API_KEY trong file ~/.hermes/.env, hoặc đăng nhập OAuth bằng hermes auth add openrouter --type oauth. Sau đó chọn model có hậu tố :free.
Giới hạn của OpenRouter cho model free, theo tài liệu của họ tại thời điểm 10/2026:
- 20 yêu cầu/phút.
- 50 yêu cầu/ngày nếu tài khoản đã mua dưới 10 credits.
- 1.000 yêu cầu/ngày nếu đã mua từ 10 credits trở lên.
Nhớ lại điều tôi nói ở đầu bài: một lượt nhờ việc của agent không phải một yêu cầu, mà có thể là chục yêu cầu. Nên mức 50/ngày thực tế chỉ đủ vài lượt hỏi đáp có dùng công cụ. Thêm nữa, danh sách model free thay đổi liên tục — hôm nay có, tháng sau nhà cung cấp rút; và điều khoản dữ liệu tuỳ từng model, có model cho phép bên cung cấp dùng dữ liệu của bạn để huấn luyện.
Kết luận công bằng: OpenRouter free hợp để thử và học, không hợp để chạy bot phục vụ cả đội hay xử lý dữ liệu khách hàng.
Nous Portal và model tự chạy (Ollama, endpoint tuỳ chỉnh)
Hai đường còn lại ít người Việt dùng nhưng đáng biết.
Nous Portal là dịch vụ của chính Nous Research: một lần đăng nhập, truy cập nhiều model (tài liệu ghi «300+ frontier agentic models») kèm Tool Gateway — bộ công cụ tìm web, tạo ảnh, chuyển văn bản thành giọng nói, điều khiển trình duyệt. Lệnh liên quan: hermes setup --portal khi cài mới, chọn Nous Portal trong hermes model, và hermes portal info để xem thông tin tài khoản. Giá thì xem trang chính thức, tôi không đoán.
Model tự chạy hợp với doanh nghiệp có dữ liệu không được ra khỏi công ty — hồ sơ nhân sự, bảng lương, hợp đồng. Cách làm: hermes model → chọn Custom endpoint, nhập API base URL của Ollama là http://localhost:11434/v1; trong config tương ứng với model.provider: custom và model.base_url. Điểm hay quên nhất: phải đặt ngữ cảnh ≥ 64K ở cả hai nơi — phía Ollama dùng -c 65536, phía Hermes đặt lại cho khớp. Và bạn cần máy đủ RAM/GPU; model chạy được trên laptop văn phòng thường yếu hơn hẳn model đám mây khi phải dùng công cụ nhiều bước.
Bảng so sánh: chọn đường nào cho nhu cầu nào?
| Đường kết nối | Cách đăng nhập | Kiểu chi phí | Hợp với | Rủi ro / giới hạn |
|---|---|---|---|---|
| ChatGPT / Codex OAuth | hermes model → ChatGPT or Codex Subscription (device code) | Thuê bao cố định | Cá nhân, nhóm nhỏ đã có gói ChatGPT | Hạn mức dùng chung theo cửa sổ 5 giờ, có thể có giới hạn tuần; gói nào đủ điều kiện chưa được tài liệu hoá |
| Claude Max OAuth | OAuth Anthropic | Thuê bao + extra usage credits | Người đã có Max và đã mua credits thêm | Claude Pro không dùng được; tài liệu Hermes đang mâu thuẫn giữa hai trang |
| Anthropic API key | ANTHROPIC_API_KEY | Trả theo token | Khối lượng việc không đều, cần model Claude | Không có trần nên hoá đơn khó đoán |
| OpenRouter (free / trả phí) | OPENROUTER_API_KEY hoặc hermes auth add openrouter --type oauth | Miễn phí có hạn / trả theo token | Thử nghiệm, so sánh nhiều model | Free: 20 req/phút, 50 hoặc 1.000 req/ngày; model free có thể bị ngừng; điều khoản dữ liệu tuỳ model |
| Nous Portal | hermes setup --portal, hermes portal info | Theo trang chính thức | Muốn một chỗ có nhiều model + công cụ sẵn | Phụ thuộc một nhà cung cấp; giá cần tự kiểm tra |
| Ollama / endpoint tuỳ chỉnh | hermes model → Custom endpoint | Chi phí phần cứng, điện | Dữ liệu nhạy cảm, không được ra ngoài | Cần RAM/GPU; model yếu hơn; phải tự đặt ngữ cảnh ≥ 64K |
Nói công bằng: gói thuê bao rẻ và dễ dự toán khi dùng vừa phải, nhưng luôn có trần. API key không có trần nhưng hoá đơn khó đoán — đặc biệt với agent gọi model nhiều lần. Tự chạy thì riêng tư nhất nhưng tốn phần cứng và chất lượng thường thấp hơn. Không có đường nào thắng tuyệt đối.
Cấu hình dự phòng để bot không đứng việc
Đây là phần tôi thấy nhiều người bỏ qua rồi sáng thứ Hai mới phát hiện bot im từ chiều thứ Sáu. Bốn việc nên làm:
- Dựng chuỗi fallback. Hermes có nhóm lệnh
hermes fallback add|list|remove|clear. Khi nhà cung cấp chính gặp lỗi giới hạn tốc độ, quá tải hoặc lỗi kết nối, agent tự chuyển sang nhà cung cấp kế tiếp trong chuỗi. Ví dụ: chính là gói ChatGPT, dự phòng là một API key trả theo token — bình thường không tốn gì, chỉ tốn khi tràn. - Xem lại model phụ. Mặc định cấu hình
auxiliary.*.provider: "auto"nghĩa là các việc phụ — xử lý ảnh, tóm tắt trang web, trộn nhiều câu trả lời — cũng dùng chính model chính. Nếu agent của bạn đọc web nhiều, chuyển model phụ sang một model rẻ hơn sẽ đỡ ăn hạn mức đáng kể. - Tách model cho cron. Các tác vụ hẹn giờ thường đơn giản (tổng hợp, nhắc việc) nên không cần model mạnh nhất. Hermes cho phép đặt model riêng cho cron — khoá cấu hình cụ thể bạn kiểm tra tài liệu chính thức tại thời điểm đọc, vì phần này thay đổi theo phiên bản.
- Đừng đổi model giữa một phiên dài. Tài liệu cấu hình model của Hermes nói rõ: đổi model giữa chừng làm mất bộ nhớ đệm prompt, lượt sau phải đọc lại toàn bộ hội thoại với giá token đầu vào đầy đủ. Muốn đổi thì đổi ở đầu phiên mới.
Thêm một điểm tiết kiệm mà ít ai để ý: không phải công cụ nào cũng cần bản trả phí. Trong 4 profile của tôi, 3 profile dùng backend tìm web miễn phí ddgs, chỉ 1 profile dùng Tavily. Trước khi nâng gói model, hãy xem lại mình có đang trả tiền cho những thứ bản miễn phí làm được không.
Lỗi hay gặp khi đổi nhà cung cấp model
- Gõ
/modeltrong phiên chat chỉ thấy một nhà cung cấp. Lệnh trong phiên chỉ chuyển giữa những thứ đã cấu hình. Muốn thêm nhà cung cấp mới thì thoát phiên và chạyhermes model. - Lỗi 429. Bạn đã chạm giới hạn tốc độ hoặc hạn mức. Hai cách: chờ hạn mức hồi, hoặc đã có chuỗi fallback thì agent tự nhảy sang đường khác.
- Token làm mới bị thu hồi (đổi mật khẩu, thu hồi phiên, quá hạn). Đăng nhập lại bằng
hermes auth add openai-codex. - Gói Claude Pro báo lỗi OAuth. Đúng như tài liệu ghi — đường này không dành cho Pro. Chuyển sang
ANTHROPIC_API_KEY.
Tóm lại và bước tiếp theo
Ba ý cần nhớ. Một, gói ChatGPT là đường dễ và rẻ nhất để bắt đầu với Hermes, đăng nhập bằng device code nên làm được cả trên VPS — nhưng hạn mức dùng chung theo cửa sổ 5 giờ và cách Hermes tính vào hạn mức thì chưa được tài liệu hoá. Hai, gói Claude chỉ dùng được ở nhánh Max đã mua thêm credits, Pro thì dùng API key; và vì tài liệu đang mâu thuẫn, hãy kiểm tra lại trước khi chi tiền. Ba, OpenRouter free để thử, không để chạy thật.
Bước tiếp theo bạn tự làm được ngay hôm nay: chạy hermes model, chọn «ChatGPT or Codex Subscription», đăng nhập bằng device code; sau đó thêm một đường dự phòng bằng hermes fallback add; cuối cùng xem lại model phụ xem có cần hạ xuống model rẻ hơn không. Mở danh sách lệnh CLI chính thức để đối chiếu, vì Hermes cập nhật rất nhanh.
Đọc thêm: Hermes Agent là gì? Agent AI tự học của Nous Research cho người mới nếu bạn mới bắt đầu, và Hermes Agent Telegram: tạo bot, chặn người lạ và dùng trong nhóm nếu bạn định cho cả phòng dùng chung một con bot — vì đó cũng chính là lúc chuyện hạn mức trong bài này trở thành vấn đề thật.
Câu hỏi thường gặp
›Dùng gói ChatGPT Plus cho Hermes Agent được không?
Được. Trong menu hermes model có lựa chọn «ChatGPT or Codex Subscription», đăng nhập bằng OAuth (mặc định là device code) và dùng các model Codex. Tuy nhiên tài liệu Hermes ghi rõ là gói nào đủ điều kiện và Hermes trừ vào hạn mức Codex ra sao hiện chưa được ghi lại, nên bạn nên thử ở mức nhỏ trước khi giao việc quan trọng cho nó.
›Có dùng gói Claude Pro cho Hermes Agent được không?
Theo trang tài liệu nhà cung cấp của Hermes thì không: đường OAuth với Anthropic chỉ chạy với gói Claude Max đã mua thêm extra usage credits, và người dùng Claude Pro không dùng được đường này. Thay thế là dùng ANTHROPIC_API_KEY trả theo token. Lưu ý một trang tài liệu khác của Hermes lại liệt kê Claude Pro/Max, nên hãy kiểm tra trang chính thức tại thời điểm bạn đọc.
›Model miễn phí trên OpenRouter có đủ cho dùng hằng ngày không?
Không đủ cho bot phục vụ cả đội. Giới hạn model có hậu tố :free là 20 yêu cầu mỗi phút, 50 yêu cầu mỗi ngày nếu tài khoản đã mua dưới 10 credits và 1.000 mỗi ngày nếu từ 10 credits trở lên. Vì một lượt nhờ việc của agent có thể gọi model cả chục lần, hạn mức free hết rất nhanh — chỉ nên dùng để thử.
›Hết hạn mức gói ChatGPT giữa chừng thì bot có ngừng không?
Có, agent sẽ báo lỗi cho tới khi hạn mức hồi lại — hạn mức Codex tính theo cửa sổ 5 giờ và có thể kèm giới hạn theo tuần. Cách tránh là dựng chuỗi dự phòng bằng hermes fallback add để agent tự chuyển sang nhà cung cấp khác khi gặp lỗi giới hạn, quá tải hoặc lỗi kết nối.
Tác giả
Chuyên gia chuyển đổi số · Đại diện 5F Edu
Hơn 8 năm triển khai và tư vấn chuyển đổi số cho doanh nghiệp vừa và nhỏ: chuẩn hoá quy trình, xây phần mềm quản lý bằng AppSheet và web app, tự động hoá bằng N8N. Người làm kênh YouTube Nghiện AppSheet.



