LLMTOKENAPI
Качество и скорость

Бенчмарки поиска.

Сравните точность ответов и скорость поисковых API на одинаковых вопросах. Для каждого результата доступны условия измерения и полный отчёт.

SimpleQA Verified

Точные ответы на короткие вопросы о фактах.

Правильные ответыВыше лучше

Выборка: 30 из 1 000 вопросов. 04.09.2026.
Один поисковый запрос, до 10 источников. Модель ответа: qwen-flash.

Методика и результаты ↗

Как устроено сравнение

  1. Вопросы из открытых наборов. SimpleQA Verified — короткие вопросы о фактах. SealQA — сложные вопросы для поиска. Выборка фиксируется до измерений; все сервисы получают одни и те же вопросы.
  2. Один поиск на вопрос. До 10 результатов, до 2 000 символов текста на каждый. Сохраняем порядок выдачи; дополнительные страницы не загружаем.
  3. Общая модель ответа и оценки. Модель отвечает по найденным источникам. Оценщик сверяет ответ с эталоном по шаблону SealQA и не получает название поискового сервиса.
  4. Точность и время отдельно. Точность — доля правильных ответов среди всех вопросов, включая отказы и ошибки поиска. p50 — медиана времени поискового вызова, p95 — время, в которое укладываются 95% успешных вызовов. Генерация ответа в это время не входит.

Это собственное сравнение с веб-поиском на вопросах официальных наборов. Оно использует другой протокол, чем исходная оценка SimpleQA Verified без инструментов. Модели и настройки могут отличаться от оценок, опубликованных конкурентами.

Результаты выборки предварительные. Зелёный цвет отмечает численное преимущество LLMTOKENAPI перед всеми участниками в выбранном показателе; статистическая значимость не проверялась. Вопросы SealQA могут зависеть от даты, а оценка использует эталоны зафиксированной версии.

04.09.2026 · 30 из 1000 вопросов

SimpleQA Verified

Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.

Качество ответов и время поиска на одной выборке
Поисковый APIТочностьНеверноБез ответаОшибки поискаp50p95
LLMTOKENAPIbalanced60%18/3039Нет1 240 мс2 253 мс
Exaauto93,3%28/3011Нет1 817 мс2 350 мс
Tavilyadvanced96,7%29/301НетНет3 181 мс6 512 мс
Keenablepublic96,7%29/301НетНет342 мс1 396 мс
04.09.2026 · 30 из 111 вопросов

SealQA · Seal-0

Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.

Качество ответов и время поиска на одной выборке
Поисковый APIТочностьНеверноБез ответаОшибки поискаp50p95
LLMTOKENAPIbalanced3,3%1/30920Нет1 389 мс4 437 мс
Exaauto10%3/30252Нет1 670 мс2 846 мс
Tavilyadvanced10%3/30252Нет3 622 мс6 201 мс
Keenablepublic6,7%2/30244Нет352 мс772 мс
04.09.2026 · 30 из 254 вопросов

SealQA · Seal-Hard

Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.

Качество ответов и время поиска на одной выборке
Поисковый APIТочностьНеверноБез ответаОшибки поискаp50p95
LLMTOKENAPIbalanced3,3%1/301217Нет1 429 мс4 275 мс
Exaauto23,3%7/30203Нет1 697 мс2 765 мс
Tavilyadvanced26,7%8/30184Нет2 848 мс5 184 мс
Keenablepublic23,3%7/301832343 мс3 904 мс

Источники методики

В основе — подход с одним поисковым запросом и общей моделью ответа, описанный Tavily. Exa также разделяет качество и скорость. Keenable публикует метрики ранжирования источников и задержки.

Предыдущие сравнения поиска источников

Ранее мы проверяли попадание эталонного домена в выдачу на собственном наборе: Hit@1, Hit@3 и MRR. Этот набор использовался при разработке и не измеряет точность ответа на вопросы SimpleQA Verified или SealQA. Исторические результаты сохранены отдельно.

Keenable · 1 сентября 2026 ↗

Exa · 29 августа 2026 ↗

Попробуйте поиск на своих вопросах →