Vink Intelligence

Knowledge graphs

Wat ReviewGraph ons leerde: structuur telt zwaarder dan een paar punten accuracy

Ons knowledge-graphmodel deed het net zo goed als een LLM bij het voorspellen van reviewscores, zonder te winnen. Waarom dat toch een sterk argument voor grafen is.

Door Bert de Vink ·

Bij ReviewGraph was de vraag simpel: kan een knowledge graph, gebouwd uit klantreviews, voorspellen welke score een gast gaf? We testten het op 10.000 hotelreviews en vergeleken het met klassieke tekstbaselines en met GPT-4o. Het eerlijke antwoord is dat het ongeveer even goed presteerde als de alternatieven en ze niet duidelijk versloeg. Juist daarom is het resultaat het opschrijven waard.

Wat we bouwden

Elke review werd omgezet in (onderwerp, predicaat, object)-triples, bijvoorbeeld een kamer en hoe de gast die beschreef, elk met een sentimentscore. Die triples werden een graaf in Neo4j. Uit de graaf haalden we twee soorten kenmerken: Node2Vec-embeddings die beschrijven hoe een review in het netwerk ligt, en sentimentsamenvattingen per review: het gemiddelde, de meest negatieve en de meest positieve relatie.

Classifiers zoals Random Forest, logistische regressie en een klein neuraal netwerk voorspelden daarna de sterrenscore. We vergeleken dit met Bag of Words-, TF-IDF- en Word2Vec-baselines, en met GPT-4o die scores voorspelde op een steekproef van dezelfde reviews.

Wat we vonden

  • Tussen de beste baseline, het beste graafmodel en het LLM zat geen wezenlijk verschil. Het graafmodel haalde een Cohens Kappa vergelijkbaar met het LLM, met een iets lagere accuracy.
  • Klein was beter. De beste configuratie gebruikte slechts 5 embeddingdimensies, en Random Forest werkte het best op deze laagdimensionale graafkenmerken, maar niet op de baselines.
  • De spreiding van het sentiment telde mee. Het toevoegen van het minimum- en maximumsentiment per review, niet alleen het gemiddelde, verbeterde de accuracy en vooral Kappa. Een review met zowel sterke lof als scherpe kritiek ziet er gemiddeld uit als je alleen naar het gemiddelde kijkt.
  • De graafstructuur alleen bevatte al voorspellende informatie. Modellen die alleen de embeddings gebruikten, deden het verrassend goed.

Waarom een gelijkspel toch een resultaat is

Als het enige doel het best mogelijke getal is, is een groot taalmodel een gemakkelijke keuze, en dit paper beweert niets anders. Maar voorspelnauwkeurigheid is zelden het enige wat een team nodig heeft. Een graaf geeft dingen die een score niet geeft.

  • Je kunt hem inspecteren. Elke voorspelling is terug te voeren op concrete nodes en relaties, zoals welke aspecten van een verblijf genoemd werden en hoe positief.
  • Je kunt hem verkennen. We bouwden een visualisatie waarin een gebruiker reviews op score kan filteren, de meest negatieve onderwerpen kan uitlichten en één review kan openen om te zien waar die over gaat.
  • Je kunt hem uitbreiden. Dezelfde graaf kan retrieval-augmented generation voeden, zodat een LLM de graaf samenvat in plaats van ruwe tekst. Dat noemen we als vervolgwerk.
  • Het paper rapporteert lagere rekenkosten dan de ensemblebenaderingen waarmee het vergelijkt.

Wat we anders zouden doen

Het zwakste onderdeel was onze triple-extractie. Die was ruw, leverde veel triples van lage kwaliteit op, en veel nodes kwamen maar één keer voor en gaven het model weinig om van te leren. We denken dat een gefinetuned taalmodel voor extractie het meest zou helpen. Node2Vec moet bovendien opnieuw getraind worden zodra er een node bijkomt, dus graph neural networks zoals GraphSAGE zijn de logische volgende stap.

Wat het betekent in de praktijk

Dit is onze eigen lezing, geen bewering uit het paper. Als data uit veel bronnen komt en mensen een voorspelling moeten begrijpen en vertrouwen, kan de structuur rond het model meer waard zijn dan een paar punten accuracy. Begin met informatie verbinden en inspecteerbaar maken, en kies daarna welk model erbovenop komt. Zo pakken we knowledge-graphprojecten aan.

Het paper beschrijft wat werkte en wat niet, inclusief de grenzen van onze eigen extractie. Lees het voor de volledige methode en cijfers.

← Alle artikelen

Een vraag over uw eigen data?

Wat ReviewGraph ons leerde: structuur telt zwaarder dan een paar punten accuracy · Vink Intelligence