Skip to main content

Speech-to-Text

audio workload

Curated

Transcribing audio to text. Streaming or batch; encoder-decoder models with modest weights but latency sensitivity when real-time.

Classification

Category
audio
Compute profile
mixed
Scaling
horizontal

Infrastructure considerations

Qualitative — no fabricated numbers
Interconnect sensitivity
low
Network sensitivity
low

Curated · Memory · Modest model weights + audio-window activations; fits on small-to-mid GPUs.

Curated · Storage · Audio input streaming; transcript output.

Typical frameworks

Curated — not a catalog relationship
PyTorchHugging FaceTensorRT

Relevant models

Models that run this workload

Data class

Curated · The workload taxonomy is authored qualitative reference, not an ingested source. Sensitivities and profiles are classifications, not measurements; a workload's concrete VRAM comes from the specific model it runs.