-
Notifications
You must be signed in to change notification settings - Fork 4.5k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
Add trainable QSA sparse attention with a TileLang backend
enhancementNew feature or requestNew feature or requestStatus: Open.#7060 In NVIDIA/Megatron-LM;Sliding-window path in FusedScaleMaskSoftmax silently discards the caller-provided attention mask
waiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7039 In NVIDIA/Megatron-LM;RuntimeError: Trying to resize storage that is not resizable in fine-grained activation offloading when force-releasing MoE expert_fc1 input that is a CUDA-graph static output
bugSomething isn't workingSomething isn't workingwaiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7009 In NVIDIA/Megatron-LM;- Status: Open.#7006 In NVIDIA/Megatron-LM;
[REGRESSION] core_v0.19.0: HF->mcore checkpoint converter broken twice — GTP_remat process groups uninitialized, and saver inherits target-derived weight-shard args
bugSomething isn't workingSomething isn't workingStatus: Open.#6989 In NVIDIA/Megatron-LM;- Status: Open.#6977 In NVIDIA/Megatron-LM;
- Status: Open.#6970 In NVIDIA/Megatron-LM;
Verify evals on Papers with Code
waiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#6947 In NVIDIA/Megatron-LM;- Status: Open.#6942 In NVIDIA/Megatron-LM;
- Status: Open.#6929 In NVIDIA/Megatron-LM;
- Status: Open.#6928 In NVIDIA/Megatron-LM;
- Status: Open.#6921 In NVIDIA/Megatron-LM;