overfeed.news

MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

OpenAI News

1y

Age

Published
Collected

We introduce MLE-bench, a benchmark for measuring how well AI agents perform at machine learning engineering.

Read the full article at openai.com

overfeed.news indexes and links. We publish a short excerpt — the full article stays at OpenAI News.

More from OpenAI News

Log in to follow this source
MLE-bench: Evaluating Machine Learning Agents on Machine…