Multimodal
Multimodality refers to a model's ability to understand and generate content using various input types—such as text, images, audio, and video.
VisionImagesSpeech
All recipes7
GPT-Live evaluation guide
AudioEvalsResponsesSpeech
Sep 10, 2026Generate Transparent Image Assets for Campaigns and Presentations
CodexImages
Aug 20, 2026Evaluating Grounded Spatial Reasoning with GPT-5.5
EvalsImagesReasoningVision
May 11, 2026Build Live Translation Apps with gpt-realtime-translate
AudioSpeech
May 7, 2026Getting the Most out of GPT-5.4 for Vision and Document Understanding
ImagesVision
Mar 6, 2026Image Evals for Image Generation and Editing Use Cases
EvalsImagesVision
Jan 29, 2026Realtime Eval Guide
AudioEvalsResponsesSpeech
Jan 25, 2026