Apple colabora con NVIDIA para reducir el tiempo de inferencia de LLM – MacMagazine

Puntuación0
Puntuación0


EL Manzana contó con la colaboración de Nvidia en una búsqueda [PDF] con el objetivo de mejorar la eficiencia y el rendimiento de grandes modelos de lenguaje (grandes modelos de lenguajeo LLM) durante la fase de inferencia, es decir, cuando generan las respuestas basadas en un determinado inmediato de texto.

Apple implementó una solución llamada Redactor recurrente (ReDrafter)que intenta mejorar la forma en que operan los modelos grandes. Actualmente, generan respuestas token por token y necesitan revisar todo lo que ya se ha generado con cada token nuevo para garantizar la coherencia, lo que requiere mucho tiempo y memoria.

ReDrafter, a su vez, crea tipos de «borradores» utilizando una red neuronal más pequeña y haciendo algo así como «suposiciones» sobre lo que generaría el modelo más grande, reduciendo las redundancias y enviando el borrador terminado al modelo principal, que revisa y acepta los «borradores correctos». ”piezas, ahorrando tiempo.

Para este trabajo, Apple integró ReDrafter en TensorRT-LLMuna biblioteca utilizada para optimizar la inferencia de modelos de lenguaje grandes en las GPU de NVIDIA, que a su vez realizó modificaciones en el sistema para adaptarse a la nueva característica de Apple y permitirle aprovechar al máximo su arquitectura.

Para permitir la integración de ReDrafter, NVIDIA agregó nuevos operadores o expuso los existentes, lo que mejoró enormemente la capacidad de TensorRT-LLM para adaptarse a modelos y métodos de decodificación sofisticados.

Los resultados obtenidos con esta asociación fueron alentadores. Con ReDrafter se observó un aumento de hasta 2.7x en la velocidad de generación de tokens por segundo, así como una aceleración de hasta 2.8x en la inferencia del modelo Vicuña en punto de referencia MT-Bench utiliza la implementación de PyTorch en GPU Nvidia H100.

Estos y otros resultados indican que la nueva tecnología es capaz de reducir significativamente la latencia en la inferencia de tokens mientras consume menos energía de las GPU, lo que puede ser relevante especialmente en dispositivos más pequeños, como Mac y iPhone.

vía 9to5Mac

Estaremos encantados de escuchar lo que piensas

Deje una respuesta

Lucas Laruffa
Logo