Общие наборы данных в формате снимков#

Можно обнаружить, что создание вложений из наборов данных является очень ресурсоемкой задачей. Если нужен практический набор данных, можно свободно выбрать один из готовых снимков на этой странице. Эти снимки содержат предварительно вычисленные векторы, которые можно легко импортировать в экземпляр Platform V Vector DB (далее - Vector DB).

Доступные наборы данных#

Снимки обычно генерируются из общедоступных наборов данных, которые часто используются для некоммерческих или академических целей. В настоящее время доступны следующие наборы данных. Пожалуйста, нажмите на название набора данных, чтобы увидеть его подробное описание.

Набор данных

Модель

Размер вектора

Документы

Размер

Снимок Vector DB

HF Hub

Заголовки Arxiv.org

InstructorXL

768

2,3 млн

7,1 ГБ

Скачать

Открыть

Аннотации Arxiv.org

InstructorXL

768

2,3 млн

8,4 ГБ

Скачать

Открыть

Еда от Wolt

clip-ViT-B-32

512

1,7 млн

7,9 ГБ

Скачать

Открыть

После скачивания снимка необходимо восстановить его с помощью интерфейса командной строки Vector DB при запуске или через API.

Vector DB на Hugging Face#

Hugging Face предоставляет платформу для обмена и использования моделей машинного обучения и наборов данных. Vector DB - одна из организаций!

Если необходимы дополнительные сведения по работе с наборами данных Hugging Face или необходимо узнать, как их объединить с Vector DB, обратитесь к дополнительному пособию.

Arxiv.org#

Arxiv.org представляет собой высоко ценимый открытый доступный репозиторий электронных препринтов по множеству областей науки. Управляемый Корнельским университетом, arXiv позволяет исследователям делиться результатами с научным сообществом и получать обратную связь до прохождения процедуры рецензирования для официальной публикации. Его архивы хранят миллионы научных статей, делая его бесценным ресурсом для тех, кто хочет изучить передовые рубежи научного исследования. С высокой частотой ежедневных поступлений от ученых со всего мира, arXiv формирует комплексный, развивающийся набор данных, который идеально подходит для добычи информации, анализа и разработки будущих инноваций.

Снимки Arxiv.org были созданы с использованием предварительно рассчитанных вложений, предоставленных индексом Alexandria.

Заголовки Arxiv.org#

Этот набор данных содержит вложения, созданные только из названий статей. Каждый вектор имеет полезную нагрузку с названием, использованным для его создания, а также DOI (идентификатор цифрового объекта).

{
    "title": "Nash Social Welfare for Indivisible Items under Separable, Piecewise-Linear Concave Utilities",
    "DOI": "1612.05191"
}

Следующий фрагмент кода показывает, как генерировать вложения с использованием модели InstructorXL:

from InstructorEmbedding import INSTRUCTOR

model = INSTRUCTOR("hkunlp/instructor-xl")
sentence = "3D ActionSLAM: wearable person tracking in multi-floor environments"
instruction = "Represent the Research Paper title for retrieval; Input:"
embeddings = model.encode([[instruction, sentence]])

Снимок набора данных может быть загружен здесь.

Импорт набора данных#

Самый простой способ воспользоваться предоставленным набором данных — восстановить его через API, передав URL-адрес в качестве местоположения. Это работает и в облаке Vector DB. Следующий фрагмент кода демонстрирует, как создать новую коллекцию и заполнить ее данными из снимка:

PUT /collections/{collection_name}/snapshots/recover
{
  "location": "https://snapshots.qdrant.io/arxiv_titles-3083016565637815127-2023-05-29-13-56-22.snapshot"
}

Аннотации Arxiv.org#

Данный набор данных содержит вложения, полученные из аннотаций статей. Каждый вектор имеет полезную нагрузку с аннотацией, используемой для его создания, а также DOI (идентификатор цифрового объекта).

{
    "abstract": "Recently Cole and Gkatzelis gave the first constant factor approximation\nalgorithm for the problem of allocating indivisible items to agents, under\nadditive valuations, so as to maximize the Nash Social Welfare. We give\nconstant factor algorithms for a substantial generalization of their problem --\nto the case of separable, piecewise-linear concave utility functions. We give\ntwo such algorithms, the first using market equilibria and the second using the\ntheory of stable polynomials.\n  In AGT, there is a paucity of methods for the design of mechanisms for the\nallocation of indivisible goods and the result of Cole and Gkatzelis seemed to\nbe taking a major step towards filling this gap. Our result can be seen as\nanother step in this direction.\n",
    "DOI": "1612.05191"
}

Следующий фрагмент кода показывает, как генерировать вложения с использованием модели InstructorXL:

from InstructorEmbedding import INSTRUCTOR

model = INSTRUCTOR("hkunlp/instructor-xl")
sentence = "The dominant sequence transduction models are based on complex recurrent or convolutional neural networks in an encoder-decoder configuration. The best performing models also connect the encoder and decoder through an attention mechanism. We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely. Experiments on two machine translation tasks show these models to be superior in quality while being more parallelizable and requiring significantly less time to train."
instruction = "Represent the Research Paper abstract for retrieval; Input:"
embeddings = model.encode([[instruction, sentence]])

Снимок набора данных может быть загружен здесь.

Импорт набора данных Arxiv.org#

Самый простой способ воспользоваться предоставленным набором данных — восстановить его через API, передав URL-адрес в качестве местоположения.

Следующий фрагмент кода демонстрирует, как создать новую коллекцию и заполнить ее данными из снимка:

PUT /collections/{collection_name}/snapshots/recover
{
  "location": "https://snapshots.qdrant.io/arxiv_abstracts-3083016565637815127-2023-06-02-07-26-29.snapshot"
}

Wolt Food#

Демонстрационный пример discovery food основан на наборе данных изображений блюд из приложения Wolt. Каждая точка в коллекции представляет блюдо с одним изображением. Изображение представлено в виде вектора из 512 чисел с плавающей запятой. К каждой точке также прикреплена полезная нагрузка в формате JSON, которая выглядит так:

{
    "cafe": {
        "address": "VGX7+6R2 Vecchia Napoli, Valletta",
        "categories": ["italian", "pasta", "pizza", "burgers", "mediterranean"],
        "location": {"lat": 35.8980154, "lon": 14.5145106},
        "menu_id": "610936a4ee8ea7a56f4a372a",
        "name": "Vecchia Napoli Is-Suq Tal-Belt",
        "rating": 9,
        "slug": "vecchia-napoli-skyparks-suq-tal-belt"
    },
    "description": "Tomato sauce, mozzarella fior di latte, crispy guanciale, Pecorino Romano cheese and a hint of chilli",
    "image": "https://wolt-menu-images-cdn.wolt.com/menu-images/610936a4ee8ea7a56f4a372a/005dfeb2-e734-11ec-b667-ced7a78a5abd_l_amatriciana_pizza_joel_gueller1.jpeg",
    "name": "L'Amatriciana"
}

Вложения, сгенерированные с помощью модели clip-ViT-B-32, были получены с использованием следующего фрагмента кода:

from PIL import Image
from sentence_transformers import SentenceTransformer

image_path = "5dbfd216-5cce-11eb-8122-de94874ad1c8_ns_takeaway_seelachs_ei_baguette.jpeg"

model = SentenceTransformer("clip-ViT-B-32")
embedding = model.encode(Image.open(image_path))

Снимок набора данных может быть загружен здесь.

Импорт набора данных Wolt Food#

Самый простой способ воспользоваться предоставленным набором данных — восстановить его через API, передав URL-адрес в качестве местоположения.
Следующий фрагмент кода демонстрирует, как создать новую коллекцию и заполнить ее данными из снимка:

PUT /collections/{collection_name}/snapshots/recover
{
  "location": "https://snapshots.qdrant.io/wolt-clip-ViT-B-32-2446808438011867-2023-12-14-15-55-26.snapshot"
}