benchmarks/web-search/multi-turn company search/most accurate search API
45 questions · multi-hop · 11 configurations

Most accurate web search API for company search

Ranked on the multi-hop search task of the web search benchmark. Each question combines three or four constraints. Rankings do not transfer from factual lookup or hard retrieval.

Exa deep (exa-deep) leads F1 at 45.4% on this run.

Most accurate for multi-hop company discovery. Read F1, then precision versus recall.

Most accurate · Fastest · Cheapest · Full benchmark

open runner + judgePublic in openbenchmarks-labs/multi-turn-company-search.github →

Ranking, sorted by f1

Search-only, ranked by f1
ProviderEndpoint & configurationF1PrecisionRecallExact setMedian timeMean turnsCost / agent runMeasured on
ExaPOST /search type=deepexa-deep45.4 ± 2.083.2 ± 3.033.7 ± 1.41.5 ± 1.389.5 s7.4$0.65645 questions135 agent runs
ExaPOST /search type=instantexa-instant43.3 ± 1.082.6 ± 3.832.2 ± 0.53.0 ± 1.349.8 s7.3$0.60145 questions135 agent runs
ParallelPOST /v1/search mode=basicparallel-basic41.4 ± 3.084.7 ± 6.129.9 ± 2.62.2 ± 0.069.1 s7.3$1.00845 questions135 agent runs
LinkupPOST /v1/search depth=fastlinkup-fast41.1 ± 1.782.8 ± 1.030.3 ± 1.50.7 ± 1.364.2 s7.4$0.83745 questions135 agent runs
TavilyPOST /search search_depth=advancedtavily-advanced41.1 ± 2.383.7 ± 4.229.8 ± 1.72.2 ± 0.092.2 s7.4$0.91045 questions135 agent runs
ParallelPOST /v1/search mode=advancedparallel-advanced40.8 ± 1.186.7 ± 2.029.2 ± 1.32.2 ± 0.087.4 s7.3$0.61445 questions135 agent runs
LinkupPOST /v1/search depth=standardlinkup-standard40.6 ± 0.984.0 ± 7.929.7 ± 1.41.5 ± 2.672.3 s7.3$0.83745 questions135 agent runs
FirecrawlPOST /v2/searchfirecrawl30.4 ± 1.177.3 ± 4.420.7 ± 0.72.2 ± 0.075.0 s7.9$0.27845 questions135 agent runs
Brave SearchGET /res/v1/web/searchbrave28.0 ± 1.766.9 ± 8.519.3 ± 0.50.7 ± 1.343.5 s8.0$0.26945 questions135 agent runs
SeltzPOST /v1/search scope=companiesseltz-companies14.5 ± 0.940.0 ± 3.19.4 ± 0.70.0 ± 0.055.2 s7.3$1.50845 questions135 agent runs
SERP (RapidAPI)GET google-search74.p.rapidapi.comserp0.4 ± 0.60.7 ± 1.30.3 ± 0.40.0 ± 0.031.4 s7.8$0.10345 questions135 agent runs

F1, precision, recall, and exact-set accuracy are percentages reported as mean ± sample SD across three independent runs; each run aggregates all 45 questions. SD is measured in percentage points. Median time is the median end-to-end time across all runs for each vendor.

Search plus fetch, same sort

Search plus fetch, ranked by f1
ProviderEndpoint & configurationF1PrecisionRecallExact setMedian timeMean turnsCost / agent runMeasured on
ExaPOST /search type=deepexa-deep48.2 ± 2.189.4 ± 1.236.0 ± 2.22.2 ± 2.295.8 s7.5$0.63945 questions135 agent runs
ExaPOST /search type=instantexa-instant44.9 ± 0.985.9 ± 2.533.5 ± 0.95.2 ± 1.352.5 s7.5$0.60645 questions135 agent runs
ParallelPOST /v1/search mode=advancedparallel-advanced42.4 ± 1.189.2 ± 2.130.0 ± 1.32.2 ± 0.083.9 s7.4$0.59945 questions135 agent runs
LinkupPOST /v1/search depth=standardlinkup-standard42.0 ± 1.890.7 ± 2.030.5 ± 2.03.0 ± 3.481.0 s7.5$0.84645 questions135 agent runs
ParallelPOST /v1/search mode=basicparallel-basic42.0 ± 4.087.0 ± 7.630.2 ± 3.23.0 ± 1.371.7 s7.2$0.94945 questions135 agent runs
TavilyPOST /search search_depth=advancedtavily-advanced41.0 ± 1.389.4 ± 6.029.1 ± 0.72.2 ± 0.092.6 s7.3$0.81345 questions135 agent runs
LinkupPOST /v1/search depth=fastlinkup-fast39.9 ± 1.385.3 ± 3.628.6 ± 1.30.7 ± 1.368.0 s7.3$0.82245 questions135 agent runs
FirecrawlPOST /v2/searchfirecrawl33.2 ± 2.183.3 ± 0.822.7 ± 1.81.5 ± 1.382.1 s7.9$0.29445 questions135 agent runs
Brave SearchGET /res/v1/web/searchbrave29.4 ± 1.673.5 ± 5.820.4 ± 0.91.5 ± 1.345.1 s8.0$0.27345 questions135 agent runs
SeltzPOST /v1/search scope=companiesseltz-companies16.3 ± 1.549.5 ± 2.410.2 ± 1.20.0 ± 0.060.1 s7.5$1.53045 questions135 agent runs
SERP (RapidAPI)GET google-search74.p.rapidapi.comserp0.0 ± 0.00.0 ± 0.00.0 ± 0.00.0 ± 0.033.4 s7.8$0.10345 questions135 agent runs

F1, precision, recall, and exact-set accuracy are percentages reported as mean ± sample SD across three independent runs; each run aggregates all 45 questions. SD is measured in percentage points. Median time is the median end-to-end time across all runs for each vendor.

Common questions

What is the most accurate web search API for company search?

Exa deep (exa-deep) leads F1 at 45.4% on 45 multi-constraint questions (search-only). Search+fetch is a separate ranking. This is multi-hop company discovery, not a one-shot lookup.