Перейти к основному содержимому

Clip

Модель OpenAI, связывающая зрение и язык. Позволяет выполнять zero-shot классификацию изображений, сопоставление изображений с текстом и кросс-модальный поиск. Обучена на 400 миллионах пар изображение-текст. Используется для поиска изображений, модерации контента или задач на стыке зрения и языка без дообучения. Лучше всего подходит для общего понимания изображений.

Метаданные навыка​

ИсточникОпционально — установка с помощью vibeos skills install official/mlops/clip
Путьoptional-skills/mlops/clip
Версия1.0.0
АвторOrchestra Research
ЛицензияMIT
Зависимостиtransformers, torch, pillow
Платформыlinux, macos, windows
ТегиMultimodal, CLIP, Vision-Language, Zero-Shot, Image Classification, OpenAI, Image Search, Cross-Modal Retrieval, Content Moderation

Справочник: полный SKILL.md​

к сведению

Далее приведено полное описание навыка, которое VibeOS загружает при его активации. Агент видит эти инструкции, когда навык активен.

CLIP — Контрастивное предобучение языка и изображений

Модель OpenAI, которая понимает изображения на естественном языке.

Когда использовать CLIP​

Используйте, когда:

  • Нужна zero-shot классификация изображений (не требует обучающих данных)
  • Требуется оценка сходства изображения и текста
  • Необходим семантический поиск изображений
  • Нужна модерация контента (обнаружение NSFW, насилия)
  • Решаются задачи визуального ответа на вопросы
  • Выполняется кросс-модальный поиск (изображение→текст, текст→изображение)

Показатели:

  • Более 25 300 звёзд на GitHub
  • Обучена на 400 миллионах пар изображение-текст
  • Сравнима с ResNet-50 на ImageNet (zero-shot)
  • Лицензия MIT

Используйте альтернативы, если:

  • BLIP-2: Нужно лучшее описание изображений
  • LLaVA: Требуется чат на основе зрения и языка
  • Segment Anything: Необходима сегментация изображений

Быстрый старт​

Установка​

pip install git+https://github.com/openai/CLIP.git
pip install torch torchvision ftfy regex tqdm

Zero-shot классификация​

import torch
import clip
from PIL import Image

# Загрузка модели
device = "cuda" if torch.cuda.is_available() else "cpu"
model, preprocess = clip.load("ViT-B/32", device=device)

# Загрузка изображения
image = preprocess(Image.open("photo.jpg")).unsqueeze(0).to(device)

# Определение возможных меток
text = clip.tokenize(["a dog", "a cat", "a bird", "a car"]).to(device)

# Вычисление сходства
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)

# Косинусное сходство
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1).cpu().numpy()

# Вывод результатов
labels = ["a dog", "a cat", "a bird", "a car"]
for label, prob in zip(labels, probs[0]):
print(f"{label}: {prob:.2%}")

Доступные модели​

# Модели (отсортированы по размеру)
models = [
"RN50", # ResNet-50
"RN101", # ResNet-101
"ViT-B/32", # Vision Transformer (рекомендуется)
"ViT-B/16", # Лучшее качество, медленнее
"ViT-L/14", # Наилучшее качество, самое медленное
]

model, preprocess = clip.load("ViT-B/32")
МодельПараметрыСкоростьКачество
RN50102MБыстраяХорошее
ViT-B/32151MСредняяЛучше
ViT-L/14428MМедленнаяНаилучшее

Сходство изображения и текста​

# Вычисление эмбеддингов
image_features = model.encode_image(image)
text_features = model.encode_text(text)

# Нормализация
image_features /= image_features.norm(dim=-1, keepdim=True)
text_features /= text_features.norm(dim=-1, keepdim=True)

# Косинусное сходство
similarity = (image_features @ text_features.T).item()
print(f"Сходство: {similarity:.4f}")

Семантический поиск изображений​

# Индексация изображений
image_paths = ["img1.jpg", "img2.jpg", "img3.jpg"]
image_embeddings = []

for img_path in image_paths:
image = preprocess(Image.open(img_path)).unsqueeze(0).to(device)
with torch.no_grad():
embedding = model.encode_image(image)
embedding /= embedding.norm(dim=-1, keepdim=True)
image_embeddings.append(embedding)

image_embeddings = torch.cat(image_embeddings)

# Поиск по текстовому запросу
query = "a sunset over the ocean"
text_input = clip.tokenize([query]).to(device)
with torch.no_grad():
text_embedding = model.encode_text(text_input)
text_embedding /= text_embedding.norm(dim=-1, keepdim=True)

# Поиск наиболее похожих изображений
similarities = (text_embedding @ image_embeddings.T).squeeze(0)
top_k = similarities.topk(3)

for idx, score in zip(top_k.indices, top_k.values):
print(f"{image_paths[idx]}: {score:.3f}")

Модерация контента​

# Определение категорий
categories = [
"safe for work",
"not safe for work",
"violent content",
"graphic content"
]

text = clip.tokenize(categories).to(device)

# Проверка изображения
with torch.no_grad():
logits_per_image, _ = model(image, text)
probs = logits_per_image.softmax(dim=-1)

# Получение классификации
max_idx = probs.argmax().item()
max_prob = probs[0, max_idx].item()

print(f"Категория: {categories[max_idx]} ({max_prob:.2%})")

Пакетная обработка​

# Обработка нескольких изображений
images = [preprocess(Image.open(f"img{i}.jpg")) for i in range(10)]
images = torch.stack(images).to(device)

with torch.no_grad():
image_features = model.encode_image(images)
image_features /= image_features.norm(dim=-1, keepdim=True)

# Пакет текстов
texts = ["a dog", "a cat", "a bird"]
text_tokens = clip.tokenize(texts).to(device)

with torch.no_grad():
text_features = model.encode_text(text_tokens)
text_features /= text_features.norm(dim=-1, keepdim=True)

# Матрица сходства (10 изображений × 3 текста)
similarities = image_features @ text_features.T
print(similarities.shape) # (10, 3)

Интеграция с векторными базами данных​

# Сохранение эмбеддингов CLIP в Chroma/FAISS
import chromadb

client = chromadb.Client()
collection = client.create_collection("image_embeddings")

# Добавление эмбеддингов изображений
for img_path, embedding in zip(image_paths, image_embeddings):
collection.add(
embeddings=[embedding.cpu().numpy().tolist()],
metadatas=[{"path": img_path}],
ids=[img_path]
)

# Запрос по тексту
query = "a sunset"
text_embedding = model.encode_text(clip.tokenize([query]))
results = collection.query(
query_embeddings=[text_embedding.cpu().numpy().tolist()],
n_results=5
)

Рекомендации​

  1. Используйте ViT-B/32 в большинстве случаев — Хороший баланс
  2. Нормализуйте эмбеддинги — Необходимо для косинусного сходства
  3. Пакетная обработка — Более эффективна
  4. Кэшируйте эмбеддинги — Дорого пересчитывать
  5. Используйте описательные метки — Лучшая производительность zero-shot
  6. Рекомендуется GPU — В 10–50 раз быстрее
  7. Предобрабатывайте изображения — Используйте встроенную функцию preprocess

Производительность​

ОперацияCPUGPU (V100)
Кодирование изображения~200ms~20ms
Кодирование текста~50ms~5ms
Вычисление сходства<1ms<1ms

Ограничения​

  1. Не подходит для детальных задач — Лучше всего работает с общими категориями
  2. Требует описательного текста — Расплывчатые метки работают плохо
  3. Смещение на веб-данных — Может содержать предвзятости датасета
  4. Нет ограничивающих рамок — Только целое изображение
  5. Ограниченное пространственное понимание — Слабая работа с позицией/подсчётом

Ресурсы​