linux-BR.org

Notícias de software livre e tecnologias

Muito obrigado a Hongxia, Chun Fang, HaiShaw, Thomas Wang, Andy Luo, Seungrok, Bill He, Teresa Shan, Parth, Duyi Wang, Gilbert e muitos mais. De baixo para cima:
PyTorch, kernels, MoRI, frameworks, ATOM, Helios tem habilitação de arco e a primeira metade da desagregação, e nenhum WideEP em lugar nenhum. Ou seja, eles fizeram avanços em otimizações individuais, como disagg, FP4, WideEP, DP-attention, etc, mas combinar muitas delas quebrou a pilha. Obviamente, os engenheiros 100x crackeados da AMD, Nvidia, Inferact, RadixArk, etc. são responsáveis ​​pelo trabalho pesado de engenharia de inferência para realmente permitir o suporte do dia 0 para esses modelos. Uma mudança de junho adicionou espelhos e portas AMD para oito grupos de teste principais: atenção V1, mecanismo, correção da API OpenAI, avaliação de modelos pequenos, pooling multimodal e três caminhos de decodificação especulativa.

Fonte: https://newsletter.semianalysis.com/p/can-amd-break-the-cuda-moat-amd-advancing