Z.ai は 8 月 14 日、大規模言語モデル GLM-5.3 をリリースしました。ベースモデルは 743B パラメータの GLM-5.2 をそのまま流用し、性能向上はすべてポストトレーニング側 — タスク環境の量、環境種の多様性、訓練の長さ — の拡大で叩き出したのが特徴です。Anthropic や OpenAI の最上位モデルに対し、コーディング領域で肉薄することを狙った位置付けです。

主なポイント

  • ベース据え置き、ポストトレのみでの底上げ。長時間コーディングの Terminal-Bench 3.0 が 4.6 ⇒ 28.3 と桁違いに上振れ
  • DeepSWE v1.1 は 46.2 ⇒ 66.9、Agents' Last Exam (CLI) は 23.8 ⇒ 28.5。長期タスク・エージェント系で改善が集中
  • Z.ai 内部 Code Bench で GLM-5.2 比 +50% 、5 万トークン予算では GLM-5.3 が 31.4% で Claude Opus 4.8 (29.5%) を上回るが、Claude Fable 5 (39.5%) には及ばず
  • 提供: Z.ai API、GLM Coding Plan、ZCode 経由で即日利用可。既存 Coding Plan 契約者にも順次展開
  • オープン重み公開はセーフティ評価とハードニング完了後の約 2 週間後を予定。サイバー能力が訓練スケールで想定より速く伸びたため慎重姿勢

出典: Z.ai debuts GLM-5.3 with long-horizon coding, cybersecurity upgrades