HeadlinesBriefing favicon HeadlinesBriefing.com

Ajuste fino de SigLip para etiquetado inmobiliario

Towards Data Science •
×

Trabajamos en Alma Media desarrollando soluciones de IA/ML para servicios de listados inmobiliarios, donde la mayoría de las fotos llegan sin información sobre lo que muestran. La búsqueda, las recomendaciones y los casos de uso internos dependen de saber si una imagen representa una cocina, un plano o un jardín. En total, hay 23 clases en esta clásica tarea de clasificación multietiqueta.

La confianza de clasificación es importante para decidir qué devolver, especialmente al distinguir el enfoque del primer plano de los elementos del fondo. Aunque las APIs de terceros que utilizan modelos de visión e idioma son un estándar moderno, ajustamos finamente google/siglip-base-patch16-224 para atender nuestras necesidades. Entrenar en modelos base ViT de código abierto requiere evaluar si tu tarea puede ser gestionada mediante prompts, si necesitas salidas JSON estructuradas y cuán críticas son las puntuaciones de confianza.

Las respuestas dependen de la aplicación. Si necesitamos encontrar todas las fotos que muestran cocinas, también queremos identificar fotos de salas de estar que muestren una cocina en el fondo. Por el contrario, consultas específicas requieren resultados enfocados. El ajuste fino con LoRA resolvió nuestro problema de sub-etiquetado, pero elegir este camino depende de tu contexto empresarial específico.

Entidades clave: Empresas: Alma Media, Google, Meta | Ubicaciones: [ADDRESS]