智谱
glm-5.3
20% offMeteredAvg latency 12.0sDegraded
openaiopenai-responseopenai-response-compactanthropicgeminiopenai-alpha-search Pricing
Struck prices are upstream official rates; the price shown is the actual settlement rate per million tokens.
Supported protocols
- Chat CompletionsopenaiPOST /v1/chat/completions
- Responses APIopenai-responsePOST /v1/responses
- Responses APIopenai-response-compactPOST /v1/responses/compact
- Messages APIanthropicPOST /v1/messages
- GenerateContentgeminiPOST /v1beta/models/{model}:generateContent
- Chat Completionsopenai-alpha-searchPOST /v1/alpha/search
Billing and limits
- Unified slug
- glm-5.3
- Billing type
- Metered
- Model ratio
- 0.56
- Completion ratio
- 3.142857142857143
- Cache ratio
- 0.1857142857142857
- Cached input price
- $0.208
- Endpoints
- openai · openai-response · openai-response-compact · anthropic · gemini · openai-alpha-search
Measured performance
Real call metrics over the last 30 days, broken out by upstream route.
| Route | Success rate | First token | Avg latency | TPS |
|---|
| default | 81.82% | 4.96s | 12.00s | 50.3 |
|---|
30-day average latency
Aug 19 – Aug 259.37s – 14.19s client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Hello"}],
stream=True,
)