HeadlinesBriefing favicon HeadlinesBriefing.com

Ajuste fino do SigLip para rotulagem imobiliária

Towards Data Science •
×

Trabalhamos na Alma Media desenvolvendo soluções de IA/ML para serviços de listagem imobiliária, onde a maioria das fotos chega sem nenhuma informação sobre o que mostram. Busca, recomendações e casos de uso internos dependem de saber se uma imagem representa uma cozinha, planta baixa ou jardim. No total, existem 23 classes nesta tarefa clássica de classificação multirótulo.

A confiança da classificação é importante para decidir o que retornar, especialmente ao distinguir o foco em primeiro plano dos elementos de fundo. Embora APIs de terceiros usando modelos de visão e linguagem sejam um padrão moderno, ajustamos finamente o google/siglip-base-patch16-224 para atender às nossas necessidades. Treinar em modelos base ViT de código aberto requer avaliar se sua tarefa pode ser direcionada eficazmente por prompts, se você precisa de saídas JSON estruturadas e quão críticos são os escores de confiança.

As respostas dependem da aplicação. Se precisamos encontrar todas as fotos que mostram cozinhas, também queremos identificar fotos de salas de estar que mostrem uma cozinha ao fundo. Por outro lado, consultas específicas exigem resultados focados. O ajuste fino com LoRA resolveu nosso problema de subrotulagem, mas escolher esse caminho depende do seu contexto comercial específico.

Entidades-chave: Empresas: Alma Media, Google, Meta | Localizações: [ADDRESS]