Perplexity has released WANDR, an open benchmark with 500 evidence-heavy tasks for testing research agents. The benchmar...

Perplexity has released WANDR, an open benchmark with 500 evidence-heavy tasks for testing research agents. The benchmark evaluates whether agents can discover many qualifying entities and back each with cited evidence. Perplexity Search as Code leads at 0.363 soft F1. https://www.marktechpost.com/2026/07/19/perplexity-ai-releases-wandr-an-open-benchmark-evaluating-research-agents-that-must-search-wide-and-deep/ #AIagent #AI #GenAI #AIResearch

Read Original

Related