Package io.github.kirstenali.deepj.layers.transformer.attention
package io.github.kirstenali.deepj.layers.transformer.attention
-
ClassesClassDescriptionCompact Multi-Head Latent Attention (MLA) inspired by DeepSeek-V2/V3.Multi-head causal self-attention for a single sequence (no batch dimension).Multi-head self-attention with Rotary Positional Embedding (RoPE).