{{getMsg('Help_YouAreHere')}}:
/
{{page.title}}
{{page.title}}
{{$root.getMsg("downLoadHelpAsPdf")}}
{{helpModel.downloadHelpPdfDataStatus}}
KI-Webquellen
Das Plugin KI-Webquellen ermöglicht der i-net Clear Reports, Inhalte konfigurierter Webseiten als KI-Informationsquelle zu nutzen. Der Crawler ruft die eingetragenen URLs periodisch ab, wandelt die Inhalte in ein strukturiertes Format um und stellt sie KI-Funktionen (z. B. Chatbots, Suche) zur Verfügung. Die Konfiguration erfolgt unter Konfiguration → KI → KI-Webquellen.
Optionen
-
Webquellen (URLs): Liste der zu crawlenden Webseiten-URLs. Einträge werden über Webseite hinzufügen ergänzt. Jede URL wird entsprechend des Crawl-Zeitplans abgerufen. Die Inhalte werden geparst und für die KI indexiert.
-
Standardwert: leere Liste
-
-
Sitemap-Erkennung: Bei einer konfigurierten Root-URL versucht der Crawler automatisch zuerst
/sitemap.xmlund danach/sitemap.txtzu laden. Enthält eine URLsitemap.xmlodersitemap.txt, wird sie direkt als Sitemap behandelt. Wird eine Sitemap gefunden, werden ihre aufgeführten Seiten gecrawlt, ohne Links in diesen Seiten rekursiv zu verfolgen. In der URL-Liste zeigt ein Sitemap-Symbol die letzte erfolgreiche Sitemap-Erkennung; andernfalls wird ein Web-Crawl-Symbol angezeigt. -
Crawl-Intervall: Wartezeit nach jedem vollständigen Crawl bis zum nächsten Lauf. Der Wert kann in Minuten, Stunden oder Tagen angegeben werden.
-
Standardwert: 1440 (24 Stunden)
-
-
Crawl-Startzeit: Tägliche Startzeit für den ersten Crawl-Lauf im Format
HH:mm(z. B.3:33für den frühen Morgen). Weitere Läufe richten sich nach dem Crawl-Intervall.-
Standardwert: 3:33
-
-
Crawl-Tiefe: Wie viele Ebenen verlinkter Seiten der Crawler von jeder konfigurierten URL aus folgt. 0 bedeutet, dass nur die angegebene Seite abgerufen wird; höhere Werte erlauben das Folgen von Links (z. B. 1 nur für direkte Links). Diese Einstellung gilt, wenn keine verwendbare Sitemap gefunden wird. Eine Begrenzung der Tiefe verhindert zu hohen Speicherbedarf, wenn die Quelle viele Verlinkungen hat (z. B. Wikipedia-Artikel).
-
Standardwert: 10
-
Hinweis: Es sollten nur öffentlich erreichbare URLs eingetragen werden. Der Crawler berücksichtigt die übliche HTTP-Semantik; Seiten, die eine Anmeldung erfordern oder automatisierten Zugriff blockieren, eignen sich nicht.
