Kog saca 3.000 tokens por segundo de una MI300X reescribiendo el motor de inferencia en ensamblador
La startup francesa Kog dice haber sacado 3.000 tokens de salida por segundo en una sola petición sobre un nodo de ocho AMD MI300X. Sin decodificación…