SIGN IN SIGN UP

CUDA: generalize FP16 fattn vec kernel (#7061)

* CUDA: generalize FP16 fattn vec kernel

* disable unsupported head sizes for AMD in test

* try AMD fix

* fix batch size 2-8

* partially revert changes
J
Johannes Gäßler committed
a743d76a01f23038b2c85af1e9048ee836767b44
Parent: f31ec12
Committed by GitHub <noreply@github.com> on 5/9/2024, 12:32:02 PM