Dokumentation / Wissen

Import aus Ihrem eigenen Speicher-Bucket

Registrieren Sie einen Bucket einmal, importieren Sie einen ganzen Ordner mit Dateien und aktualisieren Sie ihn danach nahezu kostenlos.

Zuletzt aktualisiert:

Wenn Ihre Dokumente bereits in einem Objektspeicher liegen (S3 oder etwas anderes, das dieselbe API spricht), verweisen Sie uns auf den Bucket, statt Dateien einzeln hochzuladen. Wir lesen sie dort, wo sie liegen. Sie registrieren einen Bucket einmal unter Your storage und importieren danach so oft daraus, wie Sie möchten.

Was Sie auf Ihrer Seite anlegen#

  1. Einen Ordner im Bucket mit den Dateien, die indexiert werden sollen, also handbook/policies/ statt des gesamten Buckets, es sei denn, Sie meinen tatsächlich den gesamten Bucket. Es ist das Prefix, falls Ihr Speicher es so nennt.
  2. Einen Zugriffsschlüssel, der ausschließlich diesen Ordner lesen darf. Ein Import listet den Ordner auf und liest die Objekte darin, und mehr kann er nicht. Wir schreiben nie in Ihren Bucket, löschen nie etwas darin und lesen nie außerhalb des Ordners, den Sie registriert haben.

Klicken Sie anschließend auf Register a bucket und füllen Sie Folgendes aus:

  • Speicher-Host. Der Host, unter dem Ihr Speicher antwortet, für sich allein: kein Schema davor, kein Bucket und kein Pfad darin. Wir verbinden uns immer über https, weil alles andere Ihren Zugriffsschlüssel im Klartext über die Leitung schicken würde. Eine Adresse in einem privaten Netz wird bereits bei der Registrierung abgelehnt und bei jedem Import erneut geprüft, und zwar gegen die Adresse, die wir tatsächlich erreichen.
  • Bucket und Region, falls Ihr Speicher Regionen kennt.
  • Ordner. Eine Grenze, nicht nur ein Ausgangspunkt. Ein Import kann sie enger ziehen (genau das macht Only this folder beim Import selbst), aber niemals weiter, sodass eine Quelle, die auf handbook/ registriert ist, nie dazu gebracht werden kann, den Rest des Buckets zu lesen.
  • Access key id und Secret access key.

Was mit dem Secret geschieht#

Das Secret lässt sich nur schreiben. Es wird verschlüsselt gespeichert, und nichts im Produkt liest es zurück: weder die Liste der Quellen noch die Quelle selbst noch die Secrets-API. Sie sehen danach, dass ein Schlüssel hinterlegt ist, nie aber, welcher; deshalb ist das Feld jedes Mal leer, wenn Sie die Quelle erneut öffnen.

Wir können Ihnen ein Secret daher nicht wiederherstellen. Um einen Schlüssel zu wechseln, tippen Sie das neue Secret über das alte; lassen Sie das Feld leer, bleibt der Schlüssel erhalten, den wir bereits haben. Es gibt keine Möglichkeit, ihn zu entfernen und die Quelle bestehen zu lassen, denn eine Quelle ohne Schlüssel kann nichts importieren.

Ein Import ist ein Dokument#

Jede Datei unterhalb des Ordners wird Teil eines einzigen Dokuments, genauso wie der Crawl einer ganzen Website zu einem Dokument aus vielen Seiten wird. Jede Passage trägt weiterhin die Datei, aus der sie stammt, sodass eine Antwort genau die richtige Datei zitiert. Wenn Sie ein Dokument pro Datei möchten, importieren Sie pro Dokument einen engeren Ordner.

Das Dokument erscheint sofort als Entwurf in der Sammlung, und auf der Registerkarte Processing sehen Sie den laufenden Import. Nichts ist durchsuchbar, bevor der Auftrag abgeschlossen ist und Sie veröffentlichen, genau wie bei einem Upload.

Es gelten die Upload-Grenzen Ihres Tarifs: dieselbe Größenbeschränkung pro Datei und eine Obergrenze dafür, wie viele Dateien ein Import liest. Wird die Obergrenze erreicht, meldet der Auftrag das als Warnung und nicht als Fehlschlag; grenzen Sie den Ordner dann enger ein und importieren Sie den Rest separat.

Erneut importieren, um Änderungen zu übernehmen#

Importieren Sie erneut in dasselbe Dokument, sobald sich der Bucket weiterentwickelt hat. Jede Datei wird mit dem verglichen, was wir bereits haben: Eine Datei, deren Inhalt sich nicht geändert hat, wird weder erneut geholt noch erneut indexiert, und wenn sich unterhalb des Ordners überhaupt nichts geändert hat, endet der Auftrag, ohne etwas geschrieben zu haben. Das ist günstig genug, um es so oft zu wiederholen, wie Sie möchten.

Ein erneuter Import ist keine Bearbeitung. Titel, Labels und Veröffentlichungsstatus bleiben so, wie Sie sie gesetzt haben.

Die Neuindexierung ist etwas anderes, und genau hier passiert der Fehler. Die Neuindexierung baut die Passagen aus den Kopien neu auf, die wir bereits haben, und nicht aus Ihrem Bucket; sie kann eine Datei also nicht sehen, die Sie dort hinzugefügt, geändert oder gelöscht haben. Es gibt eine Ausnahme, und sie ist kein Schlupfloch: Wenn unsere eigenen Kopien eines Dokuments abhandengekommen sind, liest eine Neuindexierung den Bucket erneut, um sie wiederherzustellen, und der Auftrag weist das aus. Ihren Speicher liest nur ein erneuter Import.

Eine Quelle ändern oder entfernen#

Wenn Sie eine Quelle bearbeiten (ein neuer Host, ein anderer Bucket, ein gewechselter Schlüssel), ändert das, was der nächste Import liest, und lässt alles bereits Indexierte genau so, wie es ist.

Das Löschen einer Quelle entfernt die Registrierung und den gespeicherten Schlüssel, sonst nichts. Es wird abgelehnt, solange noch ein Dokument existiert, das aus dieser Quelle importiert wurde, und die Ablehnung nennt eines davon. Das ist Absicht: Diese Dokumente sind Ihr indexierter Inhalt, und das Löschen eines Konfigurationsteils darf sie niemals zerstören. Löschen Sie zuerst die Dokumente, die Sie nicht mehr möchten, und entfernen Sie dann die Quelle.

In Ihrem eigenen Bucket wird nie etwas verändert, was immer Sie hier tun. Wir lesen ausschließlich daraus.

Die Konsole

Diese Seiten sind schreibgeschützt. Der Testanruf, die API-Schlüssel und die aktuelle API-Referenz finden Sie in der Konsole, in der Ihr Konto angemeldet ist.

Konsole öffnen