SIGN IN SIGN UP

A high-throughput and memory-efficient inference and serving engine for LLMs

0 0 122 Python

[Harware][AMD][Model] Triton MoE tuning configs for GLM-4.5 for MI350 and MI355 (#25586)

Signed-off-by: Reima Karhila <reima.karhila@amd.com>
Signed-off-by: xaguilar <Xavier.AguilarFruto@amd.com>
Co-authored-by: xaguilar <Xavier.AguilarFruto@amd.com>
R
Reima Karhila (AMD) committed
c253745eb8fdaac8aac4d076a37004a9deb7aac9
Parent: daec4d2
Committed by GitHub <noreply@github.com> on 10/17/2025, 11:56:12 AM