> For the complete documentation index, see [llms.txt](https://docs.artific.nl/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.artific.nl/voor-beheerders/kennisbank/geavanceerd.md).

# Geavanceerd

De machinerie onder zoektools: indexen, ophaaltools en templates. Te vinden onder **Kennisbank → Geavanceerd**.

{% hint style="info" %}
Voor het normale werk heb je dit scherm niet nodig. De [wizard voor zoektools](/voor-beheerders/kennisbank/zoektools.md) maakt en configureert alles hier voor je. Kom hier als je een specifiek probleem hebt dat de begeleide setup niet oplost, en verwacht dat het technisch wordt.
{% endhint %}

## Hoe de onderdelen samenhangen

| Onderdeel      | Wat het is                                                                                       |
| -------------- | ------------------------------------------------------------------------------------------------ |
| **Collectie**  | Waar de bestanden staan.                                                                         |
| **Index**      | De voorbereide, doorzoekbare kopie van de documenten die erin gerouteerd zijn.                   |
| **Ophaaltool** | Hoe die index bevraagd wordt. Dit is wat een assistent daadwerkelijk aanroept.                   |
| **Template**   | Een kant-en-klare blauwdruk van verwerkingsstappen die je in een index of ophaaltool kunt laden. |

Een zoektool die via de wizard is aangemaakt, is één index plus één ophaaltool die eraan gekoppeld is.

## Indexen

Een index bevat de verwerkte kopieën van je documenten. Hij wordt bepaald door welke collecties hem voeden, welke regels bepalen wat erin komt, en welke stappen elk document voorbereiden.

### Overzicht

| Instelling                 | Wat het doet                        |
| -------------------------- | ----------------------------------- |
| **Naam**                   | Herkenbare naam van de index.       |
| **Beschrijving**           | Optioneel.                          |
| **Op te nemen collecties** | Welke collecties deze index voeden. |

De samenvattingskaarten tonen hoeveel bestanden en segmenten de index bevat, welk model hij gebruikt, de vectorgrootte en wanneer hij voor het laatst is ververst. Bij het verversen kies je tussen **Incrementeel herindexeren** (alleen wat gewijzigd is) en **Volledig herindexeren** (alles).

{% hint style="warning" %}
Het model dat een index gebruikt, ligt vast bij het aanmaken en kan daarna niet meer gewijzigd worden. Wil je het veranderen, maak dan een nieuwe index aan en verplaats de collecties.
{% endhint %}

### Routeringsregels

Regels bepalen welke documenten uit de gekozen collecties daadwerkelijk in deze index komen. Laat je ze leeg, dan komt alles erin.

Elke regelgroep matcht op **alle** of **een** van zijn voorwaarden, en groepen worden met OF gecombineerd. Een voorwaarde bestaat uit een veld, een operator en een waarde:

| Veld                 | Matcht op                                                          |
| -------------------- | ------------------------------------------------------------------ |
| **Pad**              | Waar het bestand in de collectie staat.                            |
| **Bestandsnaam**     | De naam van het bestand.                                           |
| **Bestandsextensie** | Bijvoorbeeld `pdf`.                                                |
| **Bestandstype**     | Het documentformaat.                                               |
| **Label**            | Een [label](/voor-beheerders/kennisbank/labels.md) op het bestand. |

De operatoren zijn **is gelijk aan**, **is een van**, **bevat** en **begint met**.

Zo bouw je een index over "alles in Beleid met het label `openbaar`" zonder de collectie op te splitsen.

### Verwerkingsstappen

De reeks stappen die elk document voorbereidt: het bestand lezen, opschonen, in segmenten opdelen en die segmenten klaarmaken voor zoeken. De editor toont het als een diagram, met versies die je kunt aanmaken, benoemen en activeren.

{% hint style="warning" %}
De reeks waarschuwt je als er geen stap voor tabelextractie in zit. Zonder die stap worden tabellen in documenten niet uitgelezen en kunnen assistenten geen vragen over die tabelgegevens beantwoorden.
{% endhint %}

De instellingen die het meest de moeite waard zijn om te begrijpen:

| Stap               | Waarom het uitmaakt                                                                                                                                                   |
| ------------------ | --------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| **Tekstextractie** | De standaardlezer. Een geavanceerde variant doet het beter bij complexe opmaak en pdf's die op een scan lijken, maar is trager.                                       |
| **Splitsers**      | Hoe een document in segmenten wordt geknipt. Segmentgrootte en overlap zijn de belangrijkste knoppen: kleinere segmenten zijn preciezer, grotere dragen meer context. |
| **Tabelextractie** | Haalt tabellen eruit zodat ze als gegevens bevraagd kunnen worden.                                                                                                    |
| **Verrijking**     | Voegt samenvattingen, trefwoorden of andere kenmerken toe om het vinden te verbeteren.                                                                                |

Gewijzigde verwerkingsstappen gelden alleen voor documenten die daarna verwerkt worden. Herindexeer om ze toe te passen op wat er al staat.

### Geïndexeerde documenten en historie

**Bestanden in deze index** toont elk document met zijn status, en biedt **Mislukte bestanden opnieuw proberen** als er iets niet gelukt is. **Recente activiteit** toont eerdere indexeerronden, waardoor ze gestart zijn, en hoeveel documenten geïndexeerd, mislukt of overgeslagen zijn.

Dit zijn je eerste twee plekken als een assistent een document niet kan vinden waarvan je weet dat je het geüpload hebt.

## Ophaaltools

{% hint style="info" %}
In de interface heet dit tabblad **Zoektools**, dezelfde naam als de zoektools uit de wizard. Hier noemen we ze *ophaaltools*, zodat duidelijk blijft welke van de twee wordt bedoeld. Je vindt ze onder **Kennisbank → Geavanceerd**.
{% endhint %}

Een ophaaltool bepaalt *hoe* er in een index gezocht wordt. Maak er een aan met een **Naam**, een **Beschrijving**, de **Index** die hij bevraagt en een **Zoektype**:

| Zoektype       | Wat het doet                                                                   |
| -------------- | ------------------------------------------------------------------------------ |
| **Semantisch** | Matcht op betekenis.                                                           |
| **Trefwoord**  | Matcht op exacte woorden.                                                      |
| **Hybride**    | Allebei, gecombineerd. De gebruikelijke keuze.                                 |
| **Afbeelding** | Zoekt in afbeeldingen. Alleen voor een index die voor afbeeldingen is gebouwd. |

De **Beschrijving** is geen versiering: de assistent leest hem om te bepalen of hij deze tool gebruikt. Beschrijf waarin gezocht wordt en wanneer de tool ingezet moet worden.

Index en zoektype liggen vast bij het aanmaken. Wil je het ophaalgedrag daarna aanpassen, bewerk dan de zoekpijplijn.

### Uitproberen

**Uitproberen** voert een zoekopdracht uit tegen de tool en toont de gevonden segmenten met hun relevantiescores en bronnen. Het is verreweg de snelste manier om "de assistent kan X niet vinden" te onderzoeken. Komt het segment hier niet terug, dan zit het probleem in het ophalen en niet in de assistent.

### Zoekpijplijn

De stappen die draaien zodra er een vraag binnenkomt: de zoekopdrachten zelf, en daarna optioneel herrangschikken, filteren en de vraag herschrijven. De instellingen die je het vaakst zult aanpassen:

| Instelling             | Effect                                                                                                             |
| ---------------------- | ------------------------------------------------------------------------------------------------------------------ |
| **Aantal resultaten**  | Hoeveel segmenten een zoekstap teruggeeft. Meer context, meer ruis.                                                |
| **Herrangschikken**    | Zet resultaten op relevantie op volgorde voordat ze bij de assistent komen. Betere kwaliteit, iets meer wachttijd. |
| **Relevantiefilter**   | Laat zwakke treffers vallen in plaats van ze door te geven.                                                        |
| **Vraag herschrijven** | Herformuleert de vraag van de gebruiker voor het zoeken. Helpt als mensen anders formuleren dan de documenten.     |

## Templates

Alleen-lezen blauwdrukken van pijplijnstappen, meegeleverd met het platform. Blader erdoorheen op het tabblad **Templates**, gefilterd op **Verwerking** of **Zoeken**, en bekijk de stappen in een voorbeeld.

Een template laad je vanuit een pijplijneditor, niet vanaf dit scherm. Ze zijn ook wat het platform gebruikt als het een pijplijn voor je aanmaakt.
