Skip to main content
Agno agents can transcribe audio files using different tools and models. You can use native capabilities of OpenAI or fully multimodal Gemini models.
Examples of ways to do Audio to Text (Transcribe) are:

Using OpenAI Whisper (Cloud)

The following agent uses OpenAI Whisper API for audio transcription.
cookbook/tools/models/openai_tools.py
Best for: High accuracy, cloud processing

Using Multimodal Models

Multimodal models like Gemini can transcribe audio directly without additional tools.
cookbook/agents/multimodal/audio_to_text.py
Best for: Direct model integration, conversation understanding

Team-Based Transcription

Teams can handle complex audio processing workflows with multiple specialized agents.
cookbook/teams/multimodal/audio_to_text.py
Best for: Complex workflows, multiple processing steps

Developer Resources