Бенчмарки поиска.
Сравните точность ответов и скорость поисковых API на одинаковых вопросах. Для каждого результата доступны условия измерения и полный отчёт.
SimpleQA Verified
Точные ответы на короткие вопросы о фактах.
Выборка: 30 из 1 000 вопросов. 04.09.2026.
Один поисковый запрос, до 10 источников. Модель ответа: qwen-flash.
Как устроено сравнение
- Вопросы из открытых наборов. SimpleQA Verified — короткие вопросы о фактах. SealQA — сложные вопросы для поиска. Выборка фиксируется до измерений; все сервисы получают одни и те же вопросы.
- Один поиск на вопрос. До 10 результатов, до 2 000 символов текста на каждый. Сохраняем порядок выдачи; дополнительные страницы не загружаем.
- Общая модель ответа и оценки. Модель отвечает по найденным источникам. Оценщик сверяет ответ с эталоном по шаблону SealQA и не получает название поискового сервиса.
- Точность и время отдельно. Точность — доля правильных ответов среди всех вопросов, включая отказы и ошибки поиска. p50 — медиана времени поискового вызова, p95 — время, в которое укладываются 95% успешных вызовов. Генерация ответа в это время не входит.
Это собственное сравнение с веб-поиском на вопросах официальных наборов. Оно использует другой протокол, чем исходная оценка SimpleQA Verified без инструментов. Модели и настройки могут отличаться от оценок, опубликованных конкурентами.
Результаты выборки предварительные. Зелёный цвет отмечает численное преимущество LLMTOKENAPI перед всеми участниками в выбранном показателе; статистическая значимость не проверялась. Вопросы SealQA могут зависеть от даты, а оценка использует эталоны зафиксированной версии.
SimpleQA Verified
Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.
| Поисковый API | Точность | Неверно | Без ответа | Ошибки поиска | p50 | p95 |
|---|---|---|---|---|---|---|
| LLMTOKENAPIbalanced | 60%18/30 | 3 | 9 | Нет | 1 240 мс | 2 253 мс |
| Exaauto | 93,3%28/30 | 1 | 1 | Нет | 1 817 мс | 2 350 мс |
| Tavilyadvanced | 96,7%29/30 | 1 | Нет | Нет | 3 181 мс | 6 512 мс |
| Keenablepublic | 96,7%29/30 | 1 | Нет | Нет | 342 мс | 1 396 мс |
SealQA · Seal-0
Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.
| Поисковый API | Точность | Неверно | Без ответа | Ошибки поиска | p50 | p95 |
|---|---|---|---|---|---|---|
| LLMTOKENAPIbalanced | 3,3%1/30 | 9 | 20 | Нет | 1 389 мс | 4 437 мс |
| Exaauto | 10%3/30 | 25 | 2 | Нет | 1 670 мс | 2 846 мс |
| Tavilyadvanced | 10%3/30 | 25 | 2 | Нет | 3 622 мс | 6 201 мс |
| Keenablepublic | 6,7%2/30 | 24 | 4 | Нет | 352 мс | 772 мс |
SealQA · Seal-Hard
Модель ответа: qwen-flash. Модель оценки: qwen-flash. Все сервисы получают одинаковые вопросы; результаты относятся к указанной дате и выборке.
| Поисковый API | Точность | Неверно | Без ответа | Ошибки поиска | p50 | p95 |
|---|---|---|---|---|---|---|
| LLMTOKENAPIbalanced | 3,3%1/30 | 12 | 17 | Нет | 1 429 мс | 4 275 мс |
| Exaauto | 23,3%7/30 | 20 | 3 | Нет | 1 697 мс | 2 765 мс |
| Tavilyadvanced | 26,7%8/30 | 18 | 4 | Нет | 2 848 мс | 5 184 мс |
| Keenablepublic | 23,3%7/30 | 18 | 3 | 2 | 343 мс | 3 904 мс |
Источники методики
В основе — подход с одним поисковым запросом и общей моделью ответа, описанный Tavily. Exa также разделяет качество и скорость. Keenable публикует метрики ранжирования источников и задержки.
Предыдущие сравнения поиска источников
Ранее мы проверяли попадание эталонного домена в выдачу на собственном наборе: Hit@1, Hit@3 и MRR. Этот набор использовался при разработке и не измеряет точность ответа на вопросы SimpleQA Verified или SealQA. Исторические результаты сохранены отдельно.