Paper page - ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment
…A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning (2026) ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents (2026) Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL…
