SIGN IN SIGN UP

llama : use n_embd_head_v when reshaping kqv (#7327)

* llama : use n_embd_head_v instead of n_embd_head_k when reshaping kqv

* llama : use n_embd_v_gqa and n_embd_head_v instead of n_embd_k_gqa and n_embd_head_k when making a view of cached value vectors.

---------

Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com>
F
fairydreaming committed
27b040691cbe45314147c2745e891a38e9c048d4
Parent: 29c60d8
Committed by GitHub <noreply@github.com> on 5/17/2024, 11:24:38 AM