Multimodal
Multimodality refers to a model's ability to understand and generate content using various input types—such as text, images, audio, and video.
VisionImagesSpeech
All recipes7
Generate Transparent Image Assets for Campaigns and Presentations
CodexImages
Aug 20, 2026Evaluating Grounded Spatial Reasoning with GPT-5.5
EvalsImagesReasoningVision
May 11, 2026Build Live Translation Apps with gpt-realtime-translate
AudioSpeech
May 7, 2026GPT Image Generation Models Prompting Guide
ImagesVision
Apr 21, 2026Getting the Most out of GPT-5.4 for Vision and Document Understanding
ImagesVision
Mar 6, 2026Image Evals for Image Generation and Editing Use Cases
EvalsImagesVision
Jan 29, 2026Realtime Eval Guide
AudioEvalsResponsesSpeech
Jan 25, 2026