Skip to main content
The --image flag enables vision-based image analysis and description using models like GPT-4o.

Quick Start

Usage

Basic Image Description

Expected Output:

Detailed Analysis

Multiple Images

With Custom Model

Supported Formats

  • PNG (.png)
  • JPEG (.jpg, .jpeg)
  • GIF (.gif)
  • WebP (.webp)
  • BMP (.bmp)
  • SVG (.svg)
  • TIFF (.tiff)

Use Cases

Content Analysis

Accessibility

Document Analysis

Code Review

Combine with Other Features

Default Model

The default vision model is gpt-4o which provides excellent image understanding capabilities. You can override this with --llm:
Image description uses vision-capable models to analyze existing images. To generate new images from text, use --image-generate instead.