For the complete documentation index, see llms.txt. This page is also available as Markdown.

Giới thiệu LLM7: API chat tương thích OpenAI, tích hợp trong 5 phút

Giới thiệu LLM7.io — API chat tương thích OpenAI SDK, miễn phí hoặc Pro $12/tháng, hỗ trợ streaming, JSON mode, function calling và image recognition.

LLM7 là nền tảng API chat cung cấp giao diện web LLM7.chat và REST API LLM7.io, tương thích trực tiếp với OpenAI SDK. Bạn có thể bắt đầu ngay mà không cần đăng ký bằng cách dùng api_key="unused", hoặc đăng ký token tại dash.llm7.io để nhận mức giới hạn cao hơn.

LLM7 là gì?

  • LLM7.chat: Giao diện web giống ChatGPT, đăng nhập bằng Google, dùng miễn phí.

  • LLM7.io: REST API tại https://api.llm7.io/v1, tương thích 100% với OpenAI Python/JS SDK.

  • Dashboard (dash.llm7.io): Quản lý token, theo dõi usage, kiểm tra Pro allowance.

Tính năng chính

  • Chat Completions: Text generation với model selector default, fast, pro hoặc model ID cụ thể.

  • Streaming: Stream token theo chunk để giảm latency UI.

  • JSON Mode: Ép model trả về JSON hợp lệ, phù hợp structured data extraction.

  • Function Calling: Gọi function từ app, model tự quyết định khi nào cần dùng tool.

  • Image Recognition: Gửi ảnh + text để OCR, caption, visual Q&A.

  • Models API: Endpoint /v1/models trả về danh sách model realtime với pricing, context window và capability flags.

Bảng so sánh các gói

Tiêu chí
Anonymous
Free Token
Pro ($12/tháng)

Yêu cầu/giây

1

2

25

Yêu cầu/phút

10

40

1.500

Yêu cầu/giờ

60

100

15.000

Token/ngày

500.000

1.000.000

Dynamic theo billing period

Model access

turbo models

turbo models

turbo + pro models

Hướng dẫn bắt đầu

1. Cài đặt SDK

{% code title="terminal" overflow="wrap" %}

{% endcode %}

2. Cấu hình client

{% tabs %} {% tab title="Anonymous (không cần đăng ký)" %} {% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %} {% endtab %} {% tab title="Free Token / Pro Token" %} {% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %} {% endtab %} {% endtabs %}

3. Tạo chat completion

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

Streaming

Stream token để render UI tức thì:

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

JSON Mode

Ép model trả JSON hợp lệ, phù hợp cho structured extraction:

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

Lưu ý: JSON mode phụ thuộc vào model. Kiểm tra json_mode: true tại Models API /v1/models trước khi dùng.

Function Calling

Kết nối model với logic bên ngoài bằng tool calls:

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

Model sẽ tự quyết định gọi function nếu thấy cần. Bạn nhận tool_calls từ response, chạy logic, rồi trả kết quả về bằng role: "tool".

Image Recognition

Gửi ảnh URL + text prompt trong cùng một message:

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

Lưu ý: Ảnh phải là HTTPS URL. Models có modalities.input chứa image mới hỗ trợ.

Models API — Kiểm tra model realtime

Endpoint GET /v1/models trả danh sách model hiện có, bao gồm pricing, context window và các flag:

{% code title="terminal" overflow="wrap" %}

{% endcode %}

{% code title="Response" overflow="wrap" %}

{% endcode %}

Chọn model theo capability trong code

{% code title="Python" overflow="wrap" lineNumbers="true" %}

{% endcode %}

Ưu và nhược điểm

  • Ưu điểm: Miễn phí dùng ngay không cần đăng ký, tương thích OpenAI SDK 100%, API endpoint cố định, Pro plan $12/tháng hợp lý cho cá nhân.

  • Nhược điểm: Không rõ upstream model nào đang chạy sau selector default, tier turbo chỉ hỗ trợ basic capabilities, Pro allowance tính dynamic nên cần kiểm tra dashboard thường xuyên.

  • Phù hợp: Dự án cá nhân, prototyping, test prompt, tích hợp nhanh vào chatbot internal.

Lưu ý quan trọng

  • Model selection: Dùng selector (default, fast, pro) để tránh phụ thuộc vào model ID cụ thể vì catalog có thể thay đổi.

  • Rate limit: Anonymous chỉ 1 req/s — đăng ký token miễn phí để nhận 2 req/s.

  • Token counting: Input + output token đều bị tính. Kiểm tra usage trong response để theo dõi.

  • Minimum cost: Một số model có minimum_request_price_usd — dù prompt ngắn cũng bị charge tối thiểu.

Tài liệu tham khảo:

Cập nhật lần cuối