Voorspellen en plannen
Voorspellen en plannen

Reinforcement learning: wanneer wel en wanneer niet

Reinforcement learning leert door te proberen: een model neemt steeds een beslissing, krijgt een beloning of straf, en wordt zo beter. Het werkt goed voor robots, spellen en beslissingen die elkaar beïnvloeden, zoals magazijnen en dynamische prijzen. Voor de meeste bedrijfsvragen is een eenvoudiger aanpak sneller en betrouwbaarder, en dat zeggen we je eerlijk.

Een rastermagazijn met rode robots op een grid van bakken, de operationeel manager bij een pickstation, een monteur bij een stilgevallen robot.

Wat het doet

  • Robots en voertuigen leren bewegen in een ruimte
  • Beslissingen na elkaar optimaliseren, zoals voorraadbeleid
  • Prijzen of aanbiedingen bijsturen op wat werkt
  • Planningen leren die zich aanpassen aan drukte
  • Strategieën testen in een simulatie voordat ze echt gaan

Bijvoorbeeld

Een rastermagazijn met robots wil de volgorde van bakken zo kiezen dat de pickers minder wachten. We bouwen eerst een simulatie van het magazijn en vergelijken daarin een slimme vaste regel met een model dat leert. Pas als het lerende model in de simulatie duidelijk wint, gaat het op de vloer proberen.

Hoe het werkt

  1. 01

    Is het de juiste vraag?

    Gaat het om beslissingen na elkaar, die elkaar beïnvloeden, met een duidelijke beloning? Zo niet, dan is een ander model beter.

  2. 02

    Een simulatie

    Reinforcement learning leert door te proberen, en proberen doe je liever in een simulatie dan in je bedrijf.

  3. 03

    Vergelijken met eenvoudig

    We zetten het lerende model altijd naast een goede vaste regel of een optimalisatie. Wint het niet, dan nemen we het eenvoudige.

  4. 04

    Voorzichtig naar de praktijk

    Eerst meekijken, dan een klein deel, met grenzen die het model nooit mag overschrijden.

Wat je nodig hebt

  • Een beslissing die steeds opnieuw wordt genomen
  • Een maat voor wat een goede uitkomst is
  • Gegevens of kennis om een simulatie te bouwen

Zo begin je

Elke kleine stap telt mee als je doorgaat. Alle instappen.

Het hele traject loopt in de route AI aan het werk zetten.

Vragen

Wanneer is reinforcement learning de juiste keuze?

Als een model steeds opnieuw moet kiezen, de keuzes elkaar beïnvloeden, er een duidelijke beloning is en je veilig kunt oefenen in een simulatie. Robots, magazijnen, dynamische prijzen en sommige planningen voldoen daaraan.

Waarom raden jullie het vaak af?

Omdat het veel data of een goede simulatie vraagt, lastig uit te leggen is en onvoorspelbaar kan zijn. Voor de meeste bedrijfsvragen haalt een optimalisatie of een voorspellend model hetzelfde, sneller en betrouwbaarder.

Wat heeft ChatGPT met reinforcement learning te maken?

Taalmodellen worden na hun training bijgestuurd met reinforcement learning uit menselijke feedback (RLHF). Dat is iets anders dan het inzetten voor een beslissing in je eigen bedrijf.

De eigenaar van een horecagroothandel in het gangpad van zijn distributiecentrum, een klembord met een orderbon in zijn hand.

Een halfuur gratis sparren over of reinforcement learning bij jou past?

Waar loop jij tegenaan in je bedrijf? Wat kan beter? Wat kan sneller? Wat gaat nog met de hand en moet nodig geautomatiseerd worden?

  • Een halfuur sparren over jouw idee, gratis
  • Je weet direct welke route het is, hoeveel weken, en wat het kost
  • Ruwe inschatting over de prijs en het aantal weken
Wat is jouw idee?

„Een Google Maps voor ons magazijn, met filemelding bij stelling 12.”

Distributiecentrum, Waalwijk

Alexander Kaan, zwart-witfoto.

Vertel me je probleem, je geniale idee of stel gewoon wat vragen!

Alexander Kaan, product designer

Mogen we met cookies meten hoe je deze site gebruikt? Meer