Qualcomm AI Engine Direct - Add 4-bit Embedding Quantization Option (#7691)
* Qualcomm AI Engine Direct - Add 4-bit Embedding Quantization Option Summary: - Introduce 4-bit embedding quantization for prefill, kv, and hybrid mode - Fixe an assertion condition bug in the annotate_and_quant_scalar pass - Refactor passes in capture_program - Add topological sorting for passes in capture_program * fix wrong import
S
shewu-quic committed
1d43d91c453dde320186a2952781f1a7b7c650d1
Parent: a7a9565
Committed by GitHub <noreply@github.com>
on 2/3/2025, 6:22:53 PM