找到 1 篇关于此标签的文章
一个叫 Nonobench 的小测试让 43 个大模型同台做数织谜题(类似填色的逻辑推理题)。结果是所有开源模型在难题上交了白卷,最强的闭源模型也只拿到 80%。AI 看着能聊,真要一步步推理还是差口气。