Large Language Models (LLM's) transformeren ongestructureerde vastgoedinformatie naar bruikbare data voor taxaties. Een recente studie, gepubliceerd in de Journal of Real Estate Research in december 2025, toonde aan dat het gebruik van GPT-modellen om kwantitatieve kenmerken te extraheren uit vastgoedadvertenties, de nauwkeurigheid van waardebepalingen significant verbetert. Specifiek resulteerde de combinatie van geëxtraheerde kenmerken met gestructureerde data in een reductie van de root mean squared error met 24.31% en de mean absolute percentage error met 15.25% ten opzichte van modellen die alleen gestructureerde data gebruikten. Dit opent nieuwe mogelijkheden voor het ontsluiten van waarde uit voorheen onbruikbare bronnen zoals vastgoedbeschrijvingen, afbeeldingen en documenten.
Traditioneel konden waarderingsmodellen enkel gestructureerde data verwerken, zoals oppervlakte, bouwjaar en transactiegeschiedenis. Informatie over conditie, indeling en buurtkarakter, die een taxateur wel uit een advertentie haalt, werd door modellen genegeerd omdat er geen betrouwbare manier was om proza om te zetten in een variabele. De studie, die 9.842 residentiële transacties in Oslo analyseerde, gebruikte GPT-modellen om specifieke kenmerken zoals renovatiestatus, uitzicht, geluid, indeling of conditie te extraheren. Deze geëxtraheerde variabelen gedragen zich als gestructureerde data. Eerdere pogingen, zoals een studie uit 2022 met 30.218 huuraanbiedingen uit Berlijn en 32.610 huisaanbiedingen uit Los Angeles, toonden met BERT embeddings al foutreducties van respectievelijk 17.09% en 5.66%, maar de nieuwere aanpak met taalmodellen die specifieke kenmerken extraheren, levert aanzienlijk grotere winsten op door de aard van de output.
De omvang van deze foutreductie is significant, gezien de volwassenheid van Automated Valuation Model (AVM) methodologieën, waarbij incrementele verbeteringen steeds moeilijker te realiseren zijn. De winst komt niet van een beter algoritme, maar van een nieuwe databron, wat de hoeveelheid onbenut voorspellend signaal in documenten benadrukt. Een cruciaal voordeel van de nieuwe aanpak is de verklaarbaarheid: waar modellen die gebaseerd zijn op 'embeddings' niet kunnen uitleggen waarom een waardering verandert, kunnen modellen die specifieke kenmerken extraheren, zoals een gerenoveerde keuken of zuidelijke ligging, hun 'werk' tonen. Dit is een belangrijke overweging wanneer waarderingen worden aangevochten door kredietverstrekkers, taxateurs of eigenaren. Tekst is slechts de meest toegankelijke van de ongestructureerde bronnen; toekomstige toepassingen omvatten afbeeldingen en plattegronden. Een PLOS One-studie uit 2025 in Hong Kong fuseerde al exterieurfoto's, street view-beelden en remote sensing-data in een machine learning-waardekader, waarbij street view-data informatie over straatbeeldkwaliteit en de conditie van naburige gebouwen onthulde die niet in listings voorkomt.
Commerciële waardebepaling is in nog grotere mate afhankelijk van ongestructureerde context, zoals huurcontracten, kredietinformatie van huurders, bouwkundige keuringen en milieurapporten. De extractieaanpak die werkt voor residentiële advertenties, kan ook worden toegepast op lease-abstracts of technische rapporten, waarbij de resulterende kenmerken vergelijkbare modellen kunnen voeden. Er zijn echter beperkingen. De Oslo-studie richt zich op residentiële transacties in één markt, wat betekent dat de resultaten mogelijk niet direct overdraagbaar zijn naar andere markten met afwijkende advertentieconventies of openbaarmakingspraktijken. Bovendien zijn vastgoedadvertenties geschreven om te verkopen, wat een inherente bias introduceert door gunstige kenmerken te benadrukken en ongunstige te weglaten. Het is nog onduidelijk of extractiemodellen deze bias kunnen corrigeren. Een andere beperking is de toegang tot data: terwijl residentiële listingtekst overvloedig en grotendeels openbaar is, zijn commerciële huurdocumenten en conditierapporten dat niet. Dit positioneert organisaties met grote, eigen documentarchieven het best om deze methoden toe te passen op commerciële activa.
De bevindingen van dit onderzoek tonen aan dat de grens van bruikbare waarderingsdata is verschoven, en het mechanisme hierachter is niet beperkt tot listingtekst. Waar modellen voorheen werden beperkt door wat 'leesbaar' was, opent de vooruitgang in taalmodellen nu de deur naar het verwerken van een veel breder scala aan informatie. Nederlandse taxateurs, zoals die aangesloten bij het NWWI, kunnen vergelijkbare AI-modellen inzetten voor efficiëntere data-extractie en een verhoogde nauwkeurigheid van waardebepalingen, mits zij toegang hebben tot de benodigde ongestructureerde data. De concurrentievraag verschuift hiermee van wat een model kan verwerken naar welke organisatie daadwerkelijk toegang heeft tot de data.
Bron: Propmodo.




