← Все модели

Z.AI: GLM 5.3 PrimeNEW
z-ai/glm-5.3-primeтекстРассуждение
Высокоскоростная редакция GLM-5.3: полный интеллект оригинала при в 1,5–2 раза большей скорости вывода. Кодинг, агентные сценарии и длинные многоходовые задачи, потоковая генерация кода, диалог в реальном времени. Контекст 1M токенов, до 128K на ответ.
Цена вход / выход
Кэш, чтение / запись
Контекст / Макс. ответ
1M / 131K
Релиз
23 сент. 2026 г.
Параметры
messagesобязательныйreasoning_effortlow · high · maxmax_tokensопционально · алиас max_completion_tokensstreamtrue · falsetoolsfunction calling (OpenAI-формат)tool_choiceauto · none · requiredresponse_formatjson_object · json_schemaweb_search · · · providerмаршрут: order · only · ignore · sortstream_options{"include_usage": true}Тонкая настройка · 9
temperature0–2stopопциональноseedопциональноtop_p0–1top_kопциональноfrequency_penalty−2…2presence_penalty−2…2logprobstrue · falsetop_logprobs0–20Как использовать через API
from openai import OpenAI
client = OpenAI(base_url="https://api.mixen.ai/v1", api_key="mxn-...")
resp = client.chat.completions.create(
model="z-ai/glm-5.3-prime",
messages=[{"role": "user", "content": "Привет"}],
reasoning_effort="low", # low · high · max
temperature=0.7,
max_tokens=1024,
stream=False,
)
print(resp.choices[0].message.content)
# Стриминг: stream=True — ответ приходит чанками
for chunk in client.chat.completions.create(
model="z-ai/glm-5.3-prime",
messages=[{"role": "user", "content": "Привет"}],
stream=True,
):
print(chunk.choices[0].delta.content or "", end="", flush=True)
