CUDA: generalize FP16 fattn vec kernel (#7061)
* CUDA: generalize FP16 fattn vec kernel * disable unsupported head sizes for AMD in test * try AMD fix * fix batch size 2-8 * partially revert changes
J
Johannes Gäßler committed
a743d76a01f23038b2c85af1e9048ee836767b44
Parent: f31ec12
Committed by GitHub <noreply@github.com>
on 5/9/2024, 12:32:02 PM