
7/21/2025 · Paul Voigtlaender, Valentin Gabeur, Rohan Doshi
What this post added
Introduces conversational image segmentation capabilities for Gemini 2.5, allowing users to query images using natural language. This feature supports object relationships, conditional logic, abstract concepts, in-image text recognition (OCR), and multi-lingual labels. It enables new use cases in interactive media editing, safety monitoring, and insurance claims assessment. Developers can leverage this through a single API, reducing the complexity of building vision applications.