
📄清华打造LLM网络配置驾考系统:4个大模型实测,最强85%通过率,最弱仅5% NetConfArena: An Executable Benchmark for LLM Agents in Closed-Loop Network Configuration 👥 Chang Liu, Xiaohui Xie, Xinyi Chen, Yong Cui | 🏛 清华大学 📎 arxiv.org/abs/2608.23179v1 💡 一句话总结 清华用480道真实网络配置考题测了4个大模型,最强deepseek-v4-pro通过率85%,最弱qwen3-8B仅5%——开启"深度思考"反而让最强模型掉分10个百分点,原因竟是它"弃考"了。 🔬 核心发现 ① 大模型能力断层明显:deepseek-v4-pro得分0.961/通过率85%,qwen3-8B仅0.457/9.4% ② 深度思考是双刃剑:帮qwen3提升12%,却让deepseek-v4-pro掉9.9%("想太多直接弃考") ③ 四大失败模式曝光:知识缺陷、无效犹豫、提前放弃、规格偏离——后三种都不是"不会"而是"执行问题" ④ 强模型的秘密是验证:deepseek-v4-pro把59%操作用于检查,qwen3-8B只花9% 🧭 深度解读(摘要) 清华提出NetConfArena,首个支持闭环交互的LLM网络配置评测基准。基于GNS3仿真平台搭建真实多设备网络,96道协议模板生成480道考题,覆盖RIP/OSPF/BGP/VXLAN等。Agent可在环境中反复操作→观察→修正,而非一次性生成命令。3840条轨迹揭示:失败不仅因知识不足,更因规划执行和指令遵循能力不足。 🎯 启发 别再迷信"深度思考"了,清华证明:对强模型开启思考反而掉分10%,因为它"想太多做太少"直接弃考 小模型别急着上生产,qwen3-8B通过率才9%,错误动作率45%——连考场都过不了 强Agent的秘密不是配置快,而是验证多——52%的操作都在"检查作业" AI犯的错不只是"不会",更多是"不听话"——自改题目、反复犹豫、遇挫就放弃 原来网络配置AI的瓶颈不在知识,在于执行力和鲁棒性 从此看Agent评测不能只看通过率,过程指标才能暴露真问题 💬 今日金句 「给AI装上'眼睛'(闭环反馈)比装上'大脑'(深度