Performance analysis of matrix multiplication for deep learning on the edge


Abstract:

The devices designed for the Internet-of-Things encompass a large variety of distinct processor architectures, forming a highly heterogeneous zoo. In order to tackle this, we employ a simulator to estimate the performance of the matrix-matrix multiplication (gemm) kernel on processors designed to operate at the edge. Our simulator adheres to the modern implementations of gemm, advocated by GotoBLAS2, BLIS, OpenBLAS, etc., to carefully account for the amount of data transfers across the memory hierarchy of different algorithmic variants of the kernel. A small collection of experiments provide the necessary data to calibrate the simulator and deliver highly accurate estimations of the execution time for a given processor architecture.

Año de publicación:

2022

Keywords:

  • IoT processors
  • Performance Analysis
  • Matrix multiplication
  • high performance

Fuente:

scopusscopus
googlegoogle
orcidorcid

Tipo de documento:

Article

Estado:

Acceso abierto

Áreas de conocimiento:

  • Aprendizaje profundo
  • Ciencias de la computación
  • Ciencias de la computación
  • Aprendizaje automático

Áreas temáticas de Dewey:

  • Métodos informáticos especiales
  • Análisis numérico
  • Física aplicada
  • Ciencias de la computación
Procesado con IAProcesado con IA

Objetivos de Desarrollo Sostenible:

  • ODS 12: Producción y consumo responsables
  • ODS 15: Vida de ecosistemas terrestres
  • ODS 17: Alianzas para lograr los objetivos
  • ODS 8: Trabajo decente y crecimiento económico
  • ODS 9: Industria, innovación e infraestructura
Procesado con IAProcesado con IA