Le financement a été dirigé par Lachy Groom et Abstract Ventures. John Doerr, VXI Capital, Triatomic et Susa Ventures ont également pris part à la levée. Selon le communiqué de l’entreprise, le montant total levé à ce jour s’élève à 97 millions de dollars. Cette nouvelle source de capitaux sera dédiée au développement du système d’inférence nommé A-1, à l’agrandissement de l’équipe d’ingénierie et à la préparation des livraisons destinées aux clients.
Garder les paramètres d’un grand modèle dans la mémoire ne suffit pas à lui seul; il faut aussi que le processeur puisse y accéder rapidement. La SRAM sur la puce offre une vitesse de transfert élevée, mais limite la capacité. Les systèmes qui utilisent une mémoire à haut débit stockent davantage de données, cependant la communication entre le processeur et la mémoire peut devenir un goulot d’étranglement pour les modèles volumineux. Volantis affirme viser à répondre à ces deux besoins au sein d’une même architecture.
La structure de connexion que l’entreprise appelle « tissu optique » vise à réunir un grand nombre de puces mémoire au sein d’un même réservoir commun. Les données y sont véhiculées par la lumière plutôt que par des signaux électriques. Volantis indique qu’elle privilégie des composants VCSEL micro pour remplacer les lasers externes. Ce choix se trouve au cœur de l’argument selon lequel la connexion peut être adaptée pour réduire la consommation d’énergie tout en tirant parti de la chaîne de production existante. Toutefois, l’entreprise n’a pas encore publié de résultats de performance indépendants d’un système A-1 utilisé par des clients.
Les chiffres de vitesse annoncés pour l’A-1 ne constituent pas encore des objectifs atteints
Dans l’annonce de Volantis, l’A-1 est conçu pour faire fonctionner des modèles comptant plus de 20 trillions de paramètres à une vitesse pouvant atteindre environ 10 000 tokens par seconde par utilisateur. Il ne s’agit pas de valeurs mesurées pour un produit déjà commercialisé, mais bien d’objectifs de développement. Par conséquent, il est prématuré de comparer directement ces vitesses avec les systèmes actuels de NVIDIA ou AMD. La consommation d’énergie du matériel, son efficacité sur des charges de travail réelles et le coût total de possession ne pourront être appréhendés qu’à partir de résultats obtenus sur le terrain.
Une entrevue avec le fondateur Tapa Ghosh, relayée par Reuters, indique que le problème de distance de connexion sera abordé grâce au transfert des données par la lumière. Cela permettrait d’entourer le processeur avec davantage de mémoire que dans les architectures actuelles. Par ailleurs, le fait que la technologie VCSEL soit déjà employée dans divers produits grand public suggère que le composant clé ne dépend pas d’un tout nouveau procédé de fabrication. Néanmoins, connecter une telle architecture à des serveurs d’intelligence artificielle nécessitant une large bande passante et une grande échelle représente un autre défi d’ingénierie.
Volantis prévoit de livrer ses premiers moteurs d’inférence entièrement intégrés à ses clients en 2027. D’ici là, la nouvelle levée apparaîtra comme un autre exemple de la recherche de mémoire connectée au sein de l’infrastructure d’IA. La validité des affirmations de l’entreprise sera mesurée par les tailles réelles des modèles des systèmes A-1, les retards constatés et les données sur les coûts fournis par les équipes opérationnelles.




