给 Python 代码跑测试和评分,保证每次结果可复现,提交的代码在一次性容器里隔离执行。
拿来看 AI 或人写的 Python 代码到底能不能跑、对不对。提交的代码扔进一次性 Docker 容器(没网络、非 root、有资源限制),跑一遍可见测试加隐藏测试,算出一个带分数分解的评分。
https://github.com/BuddyDew/ai-code-evaluation-suite

互联网充电优质资源
优质内容内幕消息
 
 
Back to Top