Speech-to-Text
audio workload
Transcribing audio to text. Streaming or batch; encoder-decoder models with modest weights but latency sensitivity when real-time.
Classification
- Category
- audio
- Compute profile
- mixed
- Scaling
- horizontal
Infrastructure considerations
Qualitative — no fabricated numbers- Interconnect sensitivity
- low
- Network sensitivity
- low
Curated · Memory · Modest model weights + audio-window activations; fits on small-to-mid GPUs.
Curated · Storage · Audio input streaming; transcript output.
Typical frameworks
Curated — not a catalog relationshipPyTorchHugging FaceTensorRT
Relevant models
Models that run this workloadData class
Curated · The workload taxonomy is authored qualitative reference, not an ingested source. Sensitivities and profiles are classifications, not measurements; a workload's concrete VRAM comes from the specific model it runs.
