XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference

João Monteiro, Étienne Marcotte, Pierre-André Noël, Valentina Zantedeschi, David Vázquez, Nicolas Chapados, Christopher J. Pal, Perouz Taslakian

Communication écrite (2024)

Accéder à ce document
Lien externe
Ce document n'est pas archivé dans PolyPublie, mais peut être consulté chez l'éditeur officiel
Nom de la conférence:
Findings of the Association for Computational Linguistics (ACL 2024)
Lieu de la conférence:
Miami, FL, USA
Date(s) de la conférence:
2024-11-12 - 2024-11-16
Maison d'édition:
Association for Computational Linguistics
OAI:
oai:publications.polymtl.ca:74682
ORCID
Date du dépôt:
10 avr. 2026 10:20
Dernière modification:
03 oct. 2026 00:26
Citer en APA 7:
Monteiro, J., Marcotte, É., Noël, P.-A., Zantedeschi, V., Vázquez, D., Chapados, N., Pal, C. J., & Taslakian, P. (novembre 2024). XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference [Communication écrite]. Findings of the Association for Computational Linguistics (ACL 2024), Miami, FL, USA. https://doi.org/10.18653/v1/2024.findings-emnlp.896

Statistiques

Dimensions

Actions réservées au personnel

Afficher document
Afficher document