API
Поиск тоже устроен как статический индекс: около 7 000 небольших файлов, которые вместе охватывают все названия всех сериалов и фильмов и все имена персон на всех языках. Для одного запроса нужен один из них.
Файлы
https://api.watchittrackit.com/v1/search/manifest.jsonhttps://api.watchittrackit.com/v1/search/{build}/tree.jsonhttps://api.watchittrackit.com/v1/search/{build}/l/{hex}.jsonhttps://api.watchittrackit.com/v1/search/{build}/s/{hex}.jsonhttps://api.watchittrackit.com/v1/search/recent.json
Как выполнить запрос
- Прочитайте
v1/search/manifest.json, чтобы узнать id текущей сборки. - Прочитайте
v1/search/{build}/tree.json. В пределах сборки он не меняется, так что загрузите его один раз. - Нормализуйте запрос: переведите в нижний регистр, уберите диакритику и знаки препинания. Ищите по самому длинному слову, которое не является стоп-словом.
- Пройдите по дереву с этим словом, чтобы найти его файл: бакет в
l/или, если слово точно заканчивается на префиксе разбиения, сводку вs/. Имена файлов: шестнадцатеричная запись байтов префикса в UTF-8. - Оставьте записи, в которых каждое слово запроса является началом какого-либо слова имени. Сначала поставьте имена, начинающиеся со всего запроса, затем отсортируйте по популярности.
- Примените
v1/search/recent.json: в нём перечислены записи, изменённые после сборки. Удалите записи индекса для них и используйте вместо них эти. Файл меняется по мере редактирования записей, поэтому, чтобы получить свежую копию, добавьте строку запроса, которая меняется каждые несколько минут (?w=плюс текущее 5-минутное окно).
Записи
Каждая запись представляет собой массив:
| Позиция | Тип | Описание |
|---|---|---|
| 0 | string | Тип записи. |
| 1 | number | Id записи. |
| 2 | string | Совпавшее имя, на каком бы языке оно ни было. |
| 3 | number | Ранг в пределах типа: 1 000 000 означает самый популярный. |
| 4 | string | Слаг записи. |
| 5 | number | null | Год, для тайтлов. |
| 6 | string | null | Путь к миниатюре. |
Пример (JavaScript)
const BASE = "https://api.watchittrackit.com/v1/search"
const STOPWORDS = new Set(["a", "an", "and", "the", "of", "in", "on", "to", "for", "at", "by", "with", "or",
"de", "del", "la", "le", "les", "el", "los", "las", "lo", "un", "une", "et", "du", "des", "da", "do", "dos",
"der", "die", "das", "und", "ein", "eine", "den", "dem", "von", "zu", "il", "i", "e", "di", "y", "en", "het", "een", "van"])
const normalize = (s) => s.normalize("NFKD").replace(/\p{M}/gu, "").toLowerCase()
.replace(/[^\p{L}\p{N}]+/gu, " ").trim()
const hex = (s) => [...new TextEncoder().encode(s)].map((b) => b.toString(16).padStart(2, "0")).join("")
async function search(query) {
const { build } = await fetch(`${BASE}/manifest.json`).then((r) => r.json())
const tree = await fetch(`${BASE}/${build}/tree.json`).then((r) => r.json())
const q = normalize(query)
const words = q.split(" ").filter(Boolean)
const real = words.filter((w) => !STOPWORDS.has(w))
const word = (real.length ? real : words).sort((a, b) => [...b].length - [...a].length)[0]
// Walk the tree: descend while the prefix is split; stop at a bucket or a summary.
let key = "", file
for (const c of word) {
if (tree[key + c]) { key += c; continue }
const starts = tree[key] ?? []
const start = starts.filter((s) => s <= c).pop() ?? starts[0] ?? c
file = `l/${hex(key + start)}.json`
break
}
file ??= `s/${hex(key)}.json`
const res = await fetch(`${BASE}/${build}/${file}`)
let entries = res.ok ? await res.json() : []
// Records changed since the build replace the index's entries for them.
// The query string changes every 5 minutes, so caches don't serve an old copy.
const recent = await fetch(`${BASE}/recent.json?w=${Math.floor(Date.now() / 300000)}`).then((r) => r.json())
entries = entries.filter(([type, id]) => !(`${type}:${id}` in recent.records))
entries.push(...Object.values(recent.records).flat())
const seen = new Set()
return entries
.filter((e) => { const n = normalize(e[2]).split(" "); return words.every((w) => n.some((x) => x.startsWith(w))) })
.sort((a, b) => Number(normalize(b[2]).startsWith(q)) - Number(normalize(a[2]).startsWith(q)) || b[3] - a[3])
.filter(([type, id]) => !seen.has(`${type}:${id}`) && seen.add(`${type}:${id}`))
.slice(0, 30)
}
// [["tv", 81189, "Breaking Bad", 999998, "breaking-bad", 2008, "/images/tv/81189/….t.jpg"], …]
console.log(await search("breaking bad"))Индекс перестраивается ежедневно. Файлы сборки никогда не меняются, так что кэшируйте их сколько угодно; меняются только манифест и recent.json.