Documentation / Connaissances

Importer depuis votre propre bucket de stockage

Enregistrez un bucket une seule fois, importez un dossier entier de fichiers et actualisez-le pour presque rien.

Dernière mise à jour:

Si vos documents se trouvent déjà dans un stockage objet (S3, ou tout autre service qui parle la même API), indiquez-nous le bucket au lieu d'envoyer les fichiers un par un. Nous les lisons là où ils sont. Vous enregistrez un bucket une seule fois dans Your storage, puis vous importez depuis celui-ci aussi souvent que vous le souhaitez.

Ce que vous devez créer de votre côté#

  1. Un dossier à l'intérieur du bucket contenant les fichiers que vous voulez indexer : handbook/policies/ plutôt que le bucket entier, sauf si c'est bien le bucket entier que vous visez. C'est le préfixe, si votre stockage l'appelle ainsi.
  2. Une clé d'accès qui ne peut lire que ce dossier. Un import liste le dossier et lit les objets qu'il contient, et c'est tout ce qu'il peut faire. Nous n'écrivons jamais dans votre bucket, n'y supprimons jamais rien et ne lisons jamais en dehors du dossier que vous avez enregistré.

Cliquez ensuite sur Register a bucket et renseignez :

  • Hôte de stockage. L'hôte sur lequel votre stockage répond, seul : sans schéma devant, sans le bucket et sans chemin. Nous nous connectons toujours en https, car toute autre solution ferait circuler votre clé d'accès en clair sur le réseau. Une adresse sur un réseau privé est refusée au moment de l'enregistrement, et vérifiée à nouveau, sur l'adresse que nous joignons réellement, à chaque import.
  • Bucket, et Region si votre stockage a des régions.
  • Dossier. Une limite, pas seulement un point de départ. Un import peut le restreindre (c'est le rôle de Only this folder au moment de l'import lui-même) mais jamais l'élargir : une source enregistrée sur handbook/ ne pourra donc jamais être amenée à lire le reste du bucket.
  • Access key id et Secret access key.

Ce qu'il advient du secret#

Le secret est en écriture seule. Il est stocké chiffré, et rien dans le produit ne le relit : ni la liste des sources, ni la source elle-même, ni l'API des secrets. Vous pouvez ensuite voir qu'une clé est enregistrée, jamais laquelle, et c'est pourquoi le champ est vide chaque fois que vous rouvrez la source.

Nous ne pouvons donc pas en récupérer une pour vous. Pour changer de clé, saisissez le nouveau secret par-dessus l'ancien ; laisser le champ vide conserve la clé que nous détenons déjà. Il n'existe aucun moyen de la supprimer en laissant la source en place, car une source sans clé ne peut rien importer.

Un import, un document#

Chaque fichier situé sous le dossier devient une partie d'un seul et même document, de la même manière que l'exploration d'un site entier donne un seul document composé de nombreuses pages. Chaque passage conserve le fichier dont il provient, de sorte qu'une réponse cite le fichier exact. Si vous voulez un document par fichier, importez un dossier plus étroit pour chaque document.

Le document apparaît immédiatement dans la collection, à l'état de brouillon, et l'onglet Processing montre l'import en cours. Rien n'est accessible à la recherche tant que la tâche n'est pas terminée et que vous n'avez pas publié, exactement comme pour un envoi de fichier.

Les limites d'envoi de votre forfait s'appliquent : la même taille maximale par fichier, et un plafond sur le nombre de fichiers que lit un même import. L'atteinte de ce plafond est signalée sur la tâche comme un avertissement et non comme un échec ; réduisez donc le dossier et importez le reste séparément.

Réimportez pour récupérer les modifications#

Réimportez dans le même document chaque fois que le bucket a évolué. Chaque fichier est comparé à ce que nous détenons déjà : celui dont le contenu n'a pas changé n'est ni récupéré ni indexé à nouveau, et si rien n'a changé sous le dossier, la tâche se termine sans rien avoir écrit. C'est assez peu coûteux pour être répété aussi souvent que vous le voulez.

Réimporter n'est pas une modification. Le titre, les libellés et le statut de publication restent tels que vous les avez définis.

La réindexation est autre chose, et c'est là l'erreur à éviter. La réindexation reconstruit les passages à partir des copies que nous détenons déjà, et non depuis votre bucket : elle ne peut donc pas voir un fichier que vous y avez ajouté, modifié ou supprimé. Il existe une exception, et ce n'est pas une porte d'entrée : si nos propres copies d'un document ont disparu, une réindexation relit le bucket pour les reconstruire, et la tâche l'indique. C'est la réimportation qui lit votre stockage.

Modifier ou supprimer une source#

Modifier une source (un nouvel hôte, un autre bucket, une clé renouvelée) change ce que lira le prochain import et laisse tout ce qui est déjà indexé exactement en l'état.

Supprimer une source efface l'enregistrement et la clé stockée, et rien d'autre. L'opération est refusée tant qu'il existe encore un document importé depuis cette source, et le refus en nomme un. C'est délibéré : ces documents sont votre contenu indexé, et la suppression d'un élément de configuration ne doit jamais les détruire. Supprimez d'abord les documents dont vous ne voulez plus, puis retirez la source.

Rien dans votre propre bucket n'est jamais modifié, quoi que vous fassiez ici. Nous ne faisons qu'y lire.

La console

Ces pages sont en lecture seule. L'appel de test, les clés API et la référence de l'API à jour se trouvent dans la console, où votre compte est connecté.

Ouvrir la console