Vision-LLM's classificeren beschadigde pallet-blokken.
innops verkent een vision-LLM-aanpak voor kleine datasets en defecten die je in woorden kan beschrijven. Deze labnotitie beschrijft de afwegingen en de evaluatie die nodig is voordat je hiervoor kiest in plaats van een zelfgetraind model.
HET PROBLEEM
Pallet pooling-depots ontvangen duizenden teruggebrachte pallets per dag. Een klein deel heeft beschadigde blokken. De vier houten kubussen die de last dragen. En moeten eruit voor ze terug in circulatie gaan. Beschadigde blokken zijn niet visueel subtiel: barsten, ontbrekende stukken, diepe splinters. Een mens roept het in een seconde. De vraag is hoe dit te doen op depot-doorvoer zonder twintig mensen extra aan te werven.
Het instinct is om een kleine CNN te trainen: neem 50.000 beelden, label elk blok als OK/beschadigd, train een model dat draait op goedkope hardware. Dit werkt. Het is ook een zes-maanden-project met een labeling-vendor, een MLOps-pipeline, en een retraining-cadans die het depot niet wil bezitten.
DE PATTERN
Sla de training over. Voer een beeld van elke blok-zijde aan een vision-LLM. Vraag in de prompt wat als schade telt: zichtbare barst langer dan X cm, ontbrekend stuk groter dan Y, etc. Geef drie of vier few-shot voorbeelden. Gelabelde beelden van borderline-cases. Direct in de prompt. Krijg gestructureerde JSON terug: { status: "ok" | "damaged", confidence: 0-1, reason: string }.
Twee dingen tellen om dit goedkoop te laten werken op depot-doorvoer. Eerst, de prompt is het model. Elk depot heeft licht andere schade-criteria, en de prompt kan dat encoderen zonder hertraining. Tweede, de gestructureerde output maakt de eval-loop triviaal: run het model op een held-out set van menselijk gelabelde beelden, tel akkoorden, itereer de prompt waar het verschilt.
WANNEER HIERVOOR TE KIEZEN
WANNEER NIET
Sub-100ms latency-eisen (vision-LLM's zijn trager dan een CNN op-device). Criteria die niet verbaliseerbaar zijn (subtiele defecten die enkel een getraind oog vangt). Massieve doorvoer waar per-image-kost sneller oploopt dan een eenmalige training-investering zou.
WAT WE NAAR EEN KLANT-TRAJECT BRENGEN
- Anthropic. Vision capabilities docs & cookbook
- OpenAI. GPT-4 vision few-shot patterns
- Industriële CV-literatuur over pallet-blok defect-classificatie (vroege jaren 2020)
Voor je een model kiest, helpt een AI-audit om de workflow, data en foutkosten te beoordelen. Lees ook onze labnotitie over een persoonlijke knowledge base.