← Flash Papers
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
Share
Share this Flash Paper
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
https://flashpapers.ai/p/29nz4mh4fs
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
Carlos E. Jimenez, John Yang +5 more
cs.CL
2023
arXiv:2310.06770
Code
· 5.1k★
· updated 4mo ago
Details ▸
Details ▴
Claude 2 BM25 Resolve Rate:
1.96%
· SWE-bench
Claude 3 Opus BM25 Resolve Rate:
3.79%
· SWE-bench
Claude 2 Oracle Resolve Rate:
4.80%
· SWE-bench
Claude 2 BM25 Resolve Rate:
1.96%
· SWE-bench
Claude 3 Opus BM25 Resolve Rate:
3.79%
· SWE-bench
Claude 2 Oracle Resolve Rate:
4.80%
· SWE-bench