# SealQA · Seal-0: сравнение поисковых API

Дата: 2026-09-04T22:58:21.506Z. Фиксированная выборка: 30 из 111 вопросов.

| API | Режим | Правильные ответы | Без ответа | Ошибки поиска | p50 | p95 |
| --- | --- | ---: | ---: | ---: | ---: | ---: |
| LLMTOKENAPI | balanced | 3.3% (1/30) | 20 | 0 | 1389 мс | 4437 мс |
| Exa | auto | 10.0% (3/30) | 2 | 0 | 1670 мс | 2846 мс |
| Tavily | advanced | 10.0% (3/30) | 2 | 0 | 3622 мс | 6201 мс |
| Keenable | public | 6.7% (2/30) | 4 | 0 | 352 мс | 772 мс |

Каждый сервис получил одни и те же вопросы. Один поисковый вызов, до 10 результатов; до 2000 символов текста на результат. Исходный порядок выдачи сохранён. Страницы дополнительно не загружались. Поиск LLMTOKENAPI измерен через публичный HTTP API с авторизацией и биллингом. Запросы последовательные, порядок сервисов меняется циклически. Измерение прервалось на последнем вопросе из-за HTTP 502 общей модели ответа или оценки. Последний вопрос повторно проверен для всех четырёх сервисов; предыдущие 29 вопросов не повторялись. В итог вошла только полная повторная четвёрка. Незавершённая попытка не засчитывалась как ошибка поискового API.

Модель ответа: qwen-flash. Модель оценки: qwen-flash. Промпт ответа общий для всех сервисов. Лимит токенов ответа: 512; оценки: 32. Reader-ответ оценивается в пределах этого бюджета, в том числе если достиг лимита. Оценщик получает вопрос, эталон и ответ; название поискового API ему не передаётся. Использован [шаблон оценки SealQA](https://colab.research.google.com/drive/1fJunutgxNaiU6-Met_wzyEdG-tXQLfrM) с тремя исходами: правильный, неправильный, без ответа. Ошибки поискового API входят в знаменатель точности; ошибки оценщика блокируют публикацию. p50/p95 считаются по успешным поисковым вызовам без времени генерации и оценки ответа.

Это сравнение с веб-поиском по официальному набору вопросов, а не результат в оригинальном SimpleQA Verified без инструментов. Промпт ответа разработан LLMTOKENAPI; результаты не смешиваются с опубликованными оценками поставщиков на других моделях и настройках. Небольшая выборка даёт предварительную оценку; зелёный цвет отмечает численное преимущество в этой выборке, не статистическую значимость. Вопросы SealQA могут зависеть от времени: оценка использует эталоны зафиксированной версии набора.

Источник: [SealQA · Seal-0](https://huggingface.co/datasets/vtllms/sealqa). Версия: b2ecadf036972d8471a5c4cdf92aa3b3c6ba96e7.
SHA-256 исходного файла: 01f60b2b278411b2dd9aa98916c3422f1c7dfc08c214cf4ad3a3596993433fde.
Порядок выборки: SHA-256 от seed и ID; seed: llmtokenapi-search-2026-09-04.
SHA-256 шаблона ответа: 32956b0c129f8a574250aa6184aabdd44e43b611d4ca44ade47c883a2cf8e0b0.
SHA-256 шаблона оценщика: 57d2d3aed6315fcbfe5412121fbffa399f319b8c7e0de8bde258f9381390eb36.

ID вопросов: seal-0:51, seal-0:106, seal-0:98, seal-0:105, seal-0:87, seal-0:29, seal-0:59, seal-0:100, seal-0:25, seal-0:86, seal-0:92, seal-0:73, seal-0:109, seal-0:49, seal-0:31, seal-0:15, seal-0:20, seal-0:93, seal-0:70, seal-0:97, seal-0:28, seal-0:54, seal-0:102, seal-0:85, seal-0:12, seal-0:16, seal-0:71, seal-0:72, seal-0:96, seal-0:41.
