估基準(zhǔn)構(gòu)建指南)
1. 項(xiàng)目概述當(dāng)AI代理開始用代碼“捏”3D模型最近在AI和3D建模的交叉領(lǐng)域一個(gè)名為“3DCodeBench”的基準(zhǔn)測(cè)試項(xiàng)目引起了我的注意。簡(jiǎn)單來(lái)說(shuō)它試圖回答一個(gè)非常有趣的問(wèn)題如果我們讓一個(gè)AI代理Agent去完成一個(gè)復(fù)雜的3D建模任務(wù)比如“創(chuàng)建一個(gè)帶紋理的現(xiàn)代風(fēng)格咖啡桌”但它不能直接操作鼠標(biāo)在Blender或Maya里拖拽頂點(diǎn)而是必須像程序員一樣通過(guò)編寫代碼通常是Python腳本來(lái)生成這個(gè)模型我們?cè)撊绾魏饬窟@個(gè)AI代理的能力這聽起來(lái)有點(diǎn)繞但背后的邏輯非常深刻。傳統(tǒng)的3D建模評(píng)估無(wú)論是人工還是自動(dòng)化大多聚焦于最終模型的視覺質(zhì)量、幾何精度或渲染效果。然而當(dāng)建模過(guò)程本身被抽象為一段“生成模型的程序”時(shí)評(píng)估的維度就完全變了。我們不僅要看最終產(chǎn)物更要看生成這個(gè)產(chǎn)物的“過(guò)程”——代碼的質(zhì)量、邏輯的嚴(yán)謹(jǐn)性、對(duì)復(fù)雜需求的分解能力以及代碼本身的可讀性和可維護(hù)性。3DCodeBench正是為了系統(tǒng)化地評(píng)測(cè)AI代理在這種“代碼驅(qū)動(dòng)式”或“程序化”3D建模任務(wù)上的表現(xiàn)而設(shè)計(jì)的基準(zhǔn)。為什么這件事重要因?yàn)椤按怼盇gent正成為AI應(yīng)用的下一個(gè)熱點(diǎn)。一個(gè)強(qiáng)大的AI代理不應(yīng)該只是一個(gè)被動(dòng)的問(wèn)答機(jī)而應(yīng)該是一個(gè)能理解復(fù)雜指令、規(guī)劃步驟、調(diào)用工具在這里是編程API、并最終交付成果的主動(dòng)執(zhí)行者。3D建模尤其是基于代碼的程序化建模是一個(gè)完美的試金石。它要求代理同時(shí)具備空間想象力、幾何理解力、編程能力以及對(duì)特定3D庫(kù)如Blender的bpy、Open3D、PyVista等API的掌握。3DCodeBench的出現(xiàn)相當(dāng)于為這個(gè)新興領(lǐng)域建立了一套“高考”標(biāo)準(zhǔn)讓不同的AI代理能在同一套題目下公平競(jìng)技從而推動(dòng)整個(gè)方向的技術(shù)發(fā)展。2. 核心需求與挑戰(zhàn)解析為什么需要一個(gè)專門的基準(zhǔn)在深入拆解3DCodeBench的具體構(gòu)成之前我們得先弄明白為什么現(xiàn)有的3D數(shù)據(jù)集或評(píng)估方法不足以應(yīng)對(duì)“代理化程序建?!边@個(gè)新場(chǎng)景。這涉及到幾個(gè)核心的挑戰(zhàn)也正是3DCodeBench試圖解決的痛點(diǎn)。2.1 從“結(jié)果評(píng)估”到“過(guò)程與結(jié)果雙重評(píng)估”的范式轉(zhuǎn)變傳統(tǒng)的3D數(shù)據(jù)集如ShapeNet、ABC Dataset等主要提供大量的3D模型網(wǎng)格或點(diǎn)云及其類別標(biāo)簽。它們的評(píng)估指標(biāo)通常是倒角距離Chamfer Distance、體積IoU、F-score等這些指標(biāo)擅長(zhǎng)衡量?jī)蓚€(gè)靜態(tài)幾何形狀的相似度。然而對(duì)于通過(guò)代碼生成的模型僅僅比較最終網(wǎng)格是遠(yuǎn)遠(yuǎn)不夠的。假設(shè)AI代理甲寫了一段100行、結(jié)構(gòu)清晰、模塊化的Python代碼生成了一個(gè)咖啡桌。代理乙寫了一段500行、充滿重復(fù)和硬編碼的“面條代碼”也生成了一個(gè)視覺上差不多的咖啡桌。從最終結(jié)果看兩者的得分可能相近。但從“代理能力”的角度看甲顯然更優(yōu)秀因?yàn)樗a(chǎn)出的代碼質(zhì)量高易于調(diào)試、修改和復(fù)用。3DCodeBench必須引入對(duì)代碼本身的評(píng)估維度比如代碼風(fēng)格、復(fù)雜度、對(duì)API使用的規(guī)范性等。2.2 任務(wù)復(fù)雜度的層次化與可擴(kuò)展性一個(gè)合格的基準(zhǔn)不能只有“畫一個(gè)立方體”這種簡(jiǎn)單任務(wù)。它需要覆蓋從簡(jiǎn)單幾何體生成、布爾運(yùn)算到復(fù)雜機(jī)械零件建模、帶約束的裝配體創(chuàng)建再到具有藝術(shù)風(fēng)格的有機(jī)形態(tài)設(shè)計(jì)等不同難度層次的任務(wù)。每個(gè)任務(wù)都應(yīng)該有清晰、無(wú)歧義的文本描述作為“需求說(shuō)明書”。例如一個(gè)中級(jí)任務(wù)可能是“生成一個(gè)齒輪模型參數(shù)如下模數(shù)2齒數(shù)20壓力角20度厚度10mm并需要在中心有一個(gè)直徑為8mm的軸孔?!?這就要求代理不僅能生成形狀還要理解工程參數(shù)并準(zhǔn)確轉(zhuǎn)換為幾何構(gòu)造。3DCodeBench需要精心設(shè)計(jì)這樣一套具有梯度難度的任務(wù)集確保既能評(píng)估基礎(chǔ)能力又能挑戰(zhàn)頂級(jí)代理的極限。同時(shí)任務(wù)的定義方式應(yīng)該便于擴(kuò)展社區(qū)可以不斷貢獻(xiàn)新的、更具挑戰(zhàn)性的任務(wù)。2.3 對(duì)“程序化”和“可編輯性”的強(qiáng)調(diào)“程序化建模”的核心優(yōu)勢(shì)在于參數(shù)化和可編輯性。一個(gè)好的程序化模型通過(guò)調(diào)整幾個(gè)關(guān)鍵參數(shù)如齒輪的齒數(shù)、桌腿的高度就能快速生成一系列變體。因此評(píng)估時(shí)不能只評(píng)估針對(duì)一組特定參數(shù)生成的單個(gè)模型還要評(píng)估代碼是否正確地封裝了這些參數(shù)以及修改參數(shù)后生成的新模型是否仍然符合預(yù)期。這就要求基準(zhǔn)任務(wù)中明確包含“參數(shù)驗(yàn)證”環(huán)節(jié)。例如在評(píng)估了默認(rèn)參數(shù)生成的齒輪后自動(dòng)修改腳本中的齒數(shù)變量重新執(zhí)行代碼檢查新生成的齒輪齒數(shù)是否正確。2.4 執(zhí)行環(huán)境與工具鏈的標(biāo)準(zhǔn)化AI代理生成的是一段代碼這段代碼需要在某個(gè)具體的3D建模環(huán)境中執(zhí)行如Blender、OpenSCAD、Three.js等。不同的環(huán)境有不同的API和特性。為了公平比較3DCodeBench很可能需要定義一個(gè)或幾個(gè)標(biāo)準(zhǔn)的執(zhí)行環(huán)境例如一個(gè)包含特定版本Blender和Python庫(kù)的Docker容器并明確告知代理可用的工具范圍“你可以使用Blender的bpy模塊”。這確保了所有代理都在同一條起跑線上避免了因環(huán)境差異導(dǎo)致的兼容性問(wèn)題。3. 基準(zhǔn)框架的深度拆解它到底測(cè)什么基于以上挑戰(zhàn)我們可以推斷出一個(gè)成熟的3DCodeBench基準(zhǔn)應(yīng)該包含的幾個(gè)核心組成部分。雖然我無(wú)法獲取其未公開的具體實(shí)現(xiàn)但根據(jù)領(lǐng)域常識(shí)和項(xiàng)目標(biāo)題的指向我們可以構(gòu)建一個(gè)合理的框架藍(lán)圖。3.1 任務(wù)定義與描述規(guī)范每個(gè)評(píng)測(cè)任務(wù)Task應(yīng)該是一個(gè)結(jié)構(gòu)化的JSON或YAML文件至少包含以下字段task_id: 唯一任務(wù)標(biāo)識(shí)符。difficulty: 任務(wù)難度等級(jí)如初級(jí)、中級(jí)、高級(jí)、專家級(jí)。category: 任務(wù)類別如基礎(chǔ)幾何、機(jī)械零件、家具、建筑、有機(jī)形態(tài)。instruction: 自然語(yǔ)言任務(wù)描述。這是給AI代理的“需求”必須清晰、精確、無(wú)二義性。例如“創(chuàng)建一個(gè)落地?zé)裟P?。燈罩為截頭圓錐體上底面半徑5cm下底面半徑10cm高15cm。燈桿為圓柱體高120cm半徑2cm。燈罩頂部中心與燈桿頂端連接。所有部件需合理組裝模型應(yīng)為單個(gè)可導(dǎo)出的網(wǎng)格對(duì)象?!眂onstraints: 可選的約束條件列表。例如“禁止使用超過(guò)3個(gè)循環(huán)語(yǔ)句”、“必須使用函數(shù)封裝可參數(shù)化的部分”。allowed_apis: 允許使用的API或庫(kù)列表如[“bpy”, “mathutils”]。evaluation_parameters: 評(píng)估參數(shù)。例如對(duì)于參數(shù)化任務(wù)這里會(huì)定義幾組不同的參數(shù)值用于測(cè)試代碼的通用性。3.2 多維度的評(píng)估指標(biāo)體系這是3DCodeBench的靈魂。評(píng)估不能只有一個(gè)分?jǐn)?shù)而應(yīng)該是一個(gè)多維度的雷達(dá)圖。我認(rèn)為至少應(yīng)包含以下四個(gè)核心維度3.2.1 功能性正確性Functional Correctness這是底線。生成的3D模型是否滿足了任務(wù)描述中的所有要求幾何匹配度使用傳統(tǒng)指標(biāo)倒角距離、法線一致性等將生成的模型與一個(gè)或多個(gè)“黃金標(biāo)準(zhǔn)”參考模型進(jìn)行對(duì)比。對(duì)于有精確尺寸要求的任務(wù)還需要檢查關(guān)鍵尺寸的誤差。約束滿足度檢查是否違反了任務(wù)中明確的約束如“所有部件必須是一個(gè)整體”。參數(shù)化魯棒性對(duì)于參數(shù)化任務(wù)修改輸入?yún)?shù)后重新執(zhí)行代碼檢查新模型是否仍然正確。3.2.2 代碼質(zhì)量Code Quality衡量產(chǎn)出代碼本身的優(yōu)劣。靜態(tài)分析使用pylint、black、mypy等工具評(píng)估代碼的規(guī)范性PEP 8、復(fù)雜度圈復(fù)雜度、類型提示等。可讀性與結(jié)構(gòu)代碼是否模塊化函數(shù)和變量命名是否清晰是否有必要的注釋邏輯是否清晰API使用恰當(dāng)性是否使用了高效、推薦的API是否存在已知的anti-pattern例如在循環(huán)內(nèi)頻繁調(diào)用某些昂貴操作3.2.3 生成效率Generation Efficiency雖然不一定是首要目標(biāo)但對(duì)于實(shí)際應(yīng)用很重要。代碼生成時(shí)間AI代理從接收到任務(wù)到輸出完整代碼所需的時(shí)間。代碼執(zhí)行時(shí)間生成的代碼在標(biāo)準(zhǔn)環(huán)境中運(yùn)行并產(chǎn)出最終模型所需的時(shí)間。資源消耗執(zhí)行代碼時(shí)的內(nèi)存和CPU占用情況。3.2.4 泛化與創(chuàng)意能力Generalization Creativity這是更高階的要求可能出現(xiàn)在“開放挑戰(zhàn)”類任務(wù)中。指令跟隨的靈活性對(duì)于模糊或開放的指令如“設(shè)計(jì)一個(gè)未來(lái)感的椅子”生成的模型是否在符合基本要求的同時(shí)展現(xiàn)了一定的創(chuàng)意和審美代碼的復(fù)用性生成的代碼是否易于被人類或其他AI理解并修改用于完成相似但不同的任務(wù)注意在實(shí)際操作中為每個(gè)維度設(shè)計(jì)可量化的、自動(dòng)化的評(píng)分規(guī)則是最大的挑戰(zhàn)。例如“創(chuàng)意”如何打分可能需要結(jié)合人類評(píng)估Human-in-the-loop或利用一些學(xué)習(xí)到的美學(xué)評(píng)估模型。3.3 執(zhí)行與驗(yàn)證的自動(dòng)化流水線一個(gè)可用的基準(zhǔn)必須是全自動(dòng)化的。理想的工作流如下任務(wù)發(fā)布系統(tǒng)將task_id和instruction發(fā)送給待評(píng)測(cè)的AI代理。代碼生成AI代理在指定時(shí)間內(nèi)例如5分鐘生成Python代碼并返回。沙箱執(zhí)行系統(tǒng)在一個(gè)干凈的、預(yù)配置好的Docker沙箱環(huán)境中執(zhí)行返回的代碼。沙箱限制了網(wǎng)絡(luò)訪問(wèn)和文件系統(tǒng)確保安全。結(jié)果捕獲代碼執(zhí)行后系統(tǒng)會(huì)捕獲a) 控制臺(tái)輸出和錯(cuò)誤信息b) 生成的3D模型文件如.obj,.glbc) 可能的中間文件或日志。自動(dòng)評(píng)估評(píng)估腳本根據(jù)evaluation_parameters加載生成的模型運(yùn)行一系列檢查幾何對(duì)比、約束驗(yàn)證、代碼靜態(tài)分析等并生成每個(gè)維度的分?jǐn)?shù)。報(bào)告生成將所有任務(wù)的分?jǐn)?shù)匯總生成可視化的排行榜和詳細(xì)的診斷報(bào)告。這個(gè)流水線的穩(wěn)定性至關(guān)重要。需要處理各種邊緣情況代碼運(yùn)行超時(shí)、崩潰、生成無(wú)效文件、試圖執(zhí)行危險(xiǎn)操作等。4. 構(gòu)建一個(gè)簡(jiǎn)化版3DCodeBench的實(shí)操思路雖然完整的3DCodeBench是一個(gè)龐大的系統(tǒng)工程但我們可以嘗試構(gòu)建一個(gè)極簡(jiǎn)化的版本來(lái)親身體驗(yàn)其核心邏輯。這對(duì)于理解基準(zhǔn)測(cè)試的構(gòu)建和未來(lái)在此基準(zhǔn)上開發(fā)或評(píng)估AI代理都大有裨益。4.1 環(huán)境準(zhǔn)備與工具選型我們選擇Blender作為核心3D環(huán)境因?yàn)樗_源、免費(fèi)、擁有強(qiáng)大的Python APIbpy且社區(qū)活躍。核心環(huán)境Blender 3.6 LTS版本。選擇LTS以確保API的長(zhǎng)期穩(wěn)定性。Python環(huán)境直接使用Blender內(nèi)置的Python解釋器。這避免了復(fù)雜的依賴管理。自動(dòng)化工具使用Python的subprocess模塊來(lái)命令行調(diào)用Blender執(zhí)行腳本。評(píng)估庫(kù)使用trimesh庫(kù)進(jìn)行網(wǎng)格操作和基礎(chǔ)幾何比較如倒角距離計(jì)算。使用pylint進(jìn)行代碼靜態(tài)分析。一個(gè)簡(jiǎn)單的項(xiàng)目目錄結(jié)構(gòu)如下3dcodebench_demo/ ├── tasks/ # 存放任務(wù)定義文件 │ ├── task_001_basic_cube.json │ └── task_002_parametric_gear.json ├── agents/ # 存放待測(cè)試的“代理”目前可以是手寫腳本或簡(jiǎn)單AI │ └── dummy_agent.py ├── sandbox/ # 沙箱執(zhí)行目錄每次運(yùn)行清空 ├── evaluator/ # 評(píng)估腳本 │ ├── geometry_eval.py │ └── code_eval.py ├── run_benchmark.py # 主運(yùn)行腳本 └── requirements.txt # Python依賴trimesh, pylint等4.2 設(shè)計(jì)并實(shí)現(xiàn)兩個(gè)示例任務(wù)讓我們?cè)O(shè)計(jì)兩個(gè)難度遞進(jìn)的任務(wù)。任務(wù)1基礎(chǔ)立方體task_001_basic_cube.json{ task_id: 001, difficulty: beginner, category: primitive, instruction: Create a cube mesh with edge length of 2.0. The cube must be located at the world origin (0,0,0)., allowed_apis: [bpy, mathutils], evaluation: { expected_volume: 8.0, expected_bounds: [[-1,1],[-1,1],[-1,1]] } }這個(gè)任務(wù)用于測(cè)試代理是否能用最基本的API創(chuàng)建物體。任務(wù)2參數(shù)化齒輪task_002_parametric_gear.json{ task_id: 002, difficulty: intermediate, category: mechanical, instruction: Generate an involute spur gear mesh. The parameters are: module2, number_of_teeth20, pressure_angle20.0, thickness10.0, bore_diameter8.0. The gear should be centered at the origin with its face on the XY plane., allowed_apis: [bpy, mathutils, math], constraints: [The gear profile must be generated algorithmically, not imported from a pre-made file.], evaluation: { parameter_sets: [ {module: 2, teeth: 20}, {module: 2, teeth: 30}, {module: 3, teeth: 20} ] } }這個(gè)任務(wù)明顯復(fù)雜得多要求代理理解漸開線齒輪的幾何原理并將其轉(zhuǎn)化為代碼。evaluation.parameter_sets定義了用于測(cè)試參數(shù)化能力的多組參數(shù)。4.3 實(shí)現(xiàn)“代理”與執(zhí)行沙箱我們的“代理”可以是一個(gè)極其簡(jiǎn)單的腳本它讀取任務(wù)JSON文件然后根據(jù)task_id硬編碼返回對(duì)應(yīng)的解決方案代碼。在真實(shí)場(chǎng)景中這里會(huì)被GPT-4、Claude-3或?qū)iT的代碼生成模型替代。agents/dummy_agent.py示例import json def solve_task(task_file_path): with open(task_file_path, r) as f: task json.load(f) if task[task_id] 001: # 返回創(chuàng)建立方體的Blender Python腳本 code import bpy import mathutils # 清除默認(rèn)場(chǎng)景中的物體 bpy.ops.object.select_all(actionSELECT) bpy.ops.object.delete(use_globalFalse) # 創(chuàng)建立方體 bpy.ops.mesh.primitive_cube_add(size2.0, location(0,0,0)) cube bpy.context.active_object cube.name \Generated_Cube\ # 導(dǎo)出模型假設(shè)這是評(píng)估流水線要求的 import os output_path os.environ.get(OUTPUT_PATH, /tmp/output.obj) bpy.ops.export_scene.obj(filepathoutput_path, use_selectionTrue) return code elif task[task_id] 002: # 返回一個(gè)簡(jiǎn)化版的齒輪生成腳本實(shí)際需要完整的漸開線計(jì)算 code import bpy import math ... (復(fù)雜的齒輪生成算法) ... return code else: return # Task not implemented執(zhí)行沙箱的核心邏輯在run_benchmark.py中import subprocess import os import tempfile import json def run_in_blender_sandbox(task_code, output_dir): 在一個(gè)臨時(shí)目錄中將任務(wù)代碼寫入文件并用Blender在后臺(tái)執(zhí)行它。 # 1. 創(chuàng)建臨時(shí)工作目錄 with tempfile.TemporaryDirectory() as tmpdir: script_path os.path.join(tmpdir, generated_script.py) # 2. 寫入代理生成的代碼 with open(script_path, w) as f: f.write(task_code) # 3. 準(zhǔn)備Blender命令行參數(shù) # 我們啟動(dòng)一個(gè)全新的、無(wú)界面的Blender運(yùn)行我們的腳本 blender_cmd [ blender, # 假設(shè)blender命令在PATH中 --background, # 無(wú)界面模式 --factory-startup, # 忽略用戶配置確保環(huán)境干凈 --python, script_path, --, # Blender參數(shù)結(jié)束之后是我們傳給腳本的參數(shù) --output, os.path.join(output_dir, model.obj) ] # 4. 執(zhí)行并捕獲結(jié)果 env os.environ.copy() env[OUTPUT_PATH] os.path.join(output_dir, model.obj) try: result subprocess.run( blender_cmd, capture_outputTrue, textTrue, timeout30, # 設(shè)置超時(shí)防止死循環(huán) cwdtmpdir, envenv ) return { success: result.returncode 0, stdout: result.stdout, stderr: result.stderr, output_file: env[OUTPUT_PATH] if os.path.exists(env[OUTPUT_PATH]) else None } except subprocess.TimeoutExpired: return {success: False, error: Timeout}4.4 實(shí)現(xiàn)多維評(píng)估腳本評(píng)估腳本是基準(zhǔn)測(cè)試的大腦我們需要分別實(shí)現(xiàn)幾何評(píng)估和代碼評(píng)估。幾何評(píng)估 (evaluator/geometry_eval.py):import trimesh import numpy as np def evaluate_geometry(generated_model_path, task_spec): 評(píng)估生成模型的幾何正確性。 if not generated_model_path or not os.path.exists(generated_model_path): return {score: 0, error: No model generated} try: mesh trimesh.load(generated_model_path) except: return {score: 0, error: Failed to load model} scores {} # 示例檢查邊界框?qū)τ诹⒎襟w任務(wù) if expected_bounds in task_spec: expected_bounds np.array(task_spec[expected_bounds]) actual_bounds mesh.bounds # 計(jì)算邊界框的相似度例如使用IoU # ... 具體計(jì)算邏輯 ... scores[bounds_iou] iou_score # 示例檢查體積對(duì)于立方體任務(wù) if expected_volume in task_spec: if mesh.is_watertight: # 體積計(jì)算要求網(wǎng)格是水密的 volume mesh.volume volume_error abs(volume - task_spec[expected_volume]) / task_spec[expected_volume] scores[volume_error] volume_error else: scores[volume_error] None # 網(wǎng)格不封閉無(wú)法計(jì)算體積 # 更高級(jí)的評(píng)估與參考模型比較如果有的話 # if reference_model_path in task_spec: # ref_mesh trimesh.load(task_spec[reference_model_path]) # chamfer_dist compute_chamfer_distance(mesh, ref_mesh) # scores[chamfer_distance] chamfer_dist # 綜合得分這里只是一個(gè)簡(jiǎn)單示例實(shí)際需要加權(quán)平均 final_score 1.0 - np.mean([v for v in scores.values() if v is not None]) if scores else 0 return {score: max(0, final_score), details: scores}代碼評(píng)估 (evaluator/code_eval.py):import ast import pylint.lint from io import StringIO import sys def evaluate_code_quality(code_string): 使用靜態(tài)分析評(píng)估代碼質(zhì)量。 metrics {} # 1. 使用pylint進(jìn)行代碼風(fēng)格和錯(cuò)誤檢查 # 將pylint輸出重定向到字符串以便解析 old_stdout sys.stdout sys.stdout mystdout StringIO() try: # 運(yùn)行pylint禁用某些與我們的上下文無(wú)關(guān)的報(bào)告 pylint_opts [ --disableall, --enablesimilarities, --reportsn, --scoren, --output-formattext, --generated-code, # 忽略一些在生成代碼中常見的警告 ] # 我們需要將代碼寫入臨時(shí)文件供pylint分析 with tempfile.NamedTemporaryFile(modew, suffix.py, deleteFalse) as f: f.write(code_string) tmp_file f.name pylint.lint.Run([tmp_file] pylint_opts, exitFalse) os.unlink(tmp_file) except Exception as e: sys.stdout old_stdout metrics[pylint_error] str(e) return metrics finally: sys.stdout old_stdout pylint_output mystdout.getvalue() # 可以解析pylint_output提取警告/錯(cuò)誤數(shù)量、分?jǐn)?shù)等 # 這里簡(jiǎn)化為計(jì)算代碼行數(shù)和非空行數(shù)作為復(fù)雜度的一個(gè)簡(jiǎn)單代理 lines code_string.splitlines() metrics[total_lines] len(lines) metrics[non_empty_lines] len([l for l in lines if l.strip()]) # 2. 使用AST進(jìn)行簡(jiǎn)單結(jié)構(gòu)分析 try: tree ast.parse(code_string) # 計(jì)算函數(shù)定義數(shù)量 num_functions len([node for node in ast.walk(tree) if isinstance(node, ast.FunctionDef)]) metrics[num_functions] num_functions # 計(jì)算循環(huán)和條件語(yǔ)句的復(fù)雜度簡(jiǎn)化版 loops len([node for node in ast.walk(tree) if isinstance(node, (ast.For, ast.While))]) conditions len([node for node in ast.walk(tree) if isinstance(node, ast.If)]) metrics[control_flow_complexity] loops conditions except SyntaxError: metrics[syntax_error] True return metrics4.5 集成與運(yùn)行主流程最后我們將所有部分集成到run_benchmark.py的主函數(shù)中def main(): tasks_to_run [tasks/task_001_basic_cube.json, tasks/task_002_parametric_gear.json] results [] for task_file in tasks_to_run: print(f\n Processing {task_file} ) # 1. 加載任務(wù) with open(task_file, r) as f: task json.load(f) # 2. 調(diào)用“代理”生成代碼 from agents.dummy_agent import solve_task generated_code solve_task(task_file) # 3. 在沙箱中執(zhí)行代碼 sandbox_output_dir fsandbox/run_{task[task_id]} os.makedirs(sandbox_output_dir, exist_okTrue) execution_result run_in_blender_sandbox(generated_code, sandbox_output_dir) # 4. 評(píng)估結(jié)果 task_result {task_id: task[task_id]} # 4.1 評(píng)估幾何正確性 if execution_result[success] and execution_result[output_file]: geom_eval evaluate_geometry(execution_result[output_file], task.get(evaluation, {})) task_result[geometry_score] geom_eval.get(score, 0) task_result[geometry_details] geom_eval.get(details, {}) else: task_result[geometry_score] 0 task_result[execution_error] execution_result.get(stderr, Unknown error) # 4.2 評(píng)估代碼質(zhì)量 code_metrics evaluate_code_quality(generated_code) task_result[code_metrics] code_metrics # 可以基于metrics計(jì)算一個(gè)代碼質(zhì)量分?jǐn)?shù) # 例如鼓勵(lì)模塊化有函數(shù)定義、控制適中的復(fù)雜度 code_score 0.5 # 基礎(chǔ)分 if code_metrics.get(num_functions, 0) 0: code_score 0.2 if code_metrics.get(control_flow_complexity, 100) 20: # 復(fù)雜度不太高 code_score 0.3 task_result[code_score] min(1.0, code_score) # 5. 計(jì)算綜合得分例如幾何70% 代碼30% task_result[final_score] ( 0.7 * task_result[geometry_score] 0.3 * task_result[code_score] ) results.append(task_result) print(fTask {task[task_id]} completed. Final Score: {task_result[final_score]:.2f}) # 6. 輸出總結(jié)報(bào)告 print(\n *50) print(Benchmark Summary) print(*50) for r in results: print(fTask {r[task_id]}: {r[final_score]:.2f} (Geometry: {r[geometry_score]:.2f}, Code: {r[code_score]:.2f})) # 可以將results保存為JSON文件用于后續(xù)分析 with open(benchmark_results.json, w) as f: json.dump(results, f, indent2) if __name__ __main__: main()5. 從基準(zhǔn)構(gòu)建到實(shí)際應(yīng)用的挑戰(zhàn)與對(duì)策構(gòu)建一個(gè)玩具版的基準(zhǔn)是一回事打造一個(gè)被社區(qū)廣泛認(rèn)可、能夠真正推動(dòng)技術(shù)發(fā)展的3DCodeBench則是另一回事。在實(shí)際操作中我們會(huì)遇到一系列嚴(yán)峻的挑戰(zhàn)。5.1 任務(wù)設(shè)計(jì)的“主觀性”與“客觀性”平衡最大的挑戰(zhàn)在于如何設(shè)計(jì)既富有挑戰(zhàn)性、又能被客觀評(píng)估的任務(wù)。過(guò)于簡(jiǎn)單的任務(wù)如畫立方體無(wú)法區(qū)分代理的能力過(guò)于開放的任務(wù)如“設(shè)計(jì)一把漂亮的椅子”則難以進(jìn)行自動(dòng)化評(píng)估嚴(yán)重依賴主觀的人工評(píng)分。對(duì)策采用分層任務(wù)設(shè)計(jì)?;A(chǔ)層完全客觀的任務(wù)。有唯一或少數(shù)幾個(gè)明確正確的解評(píng)估指標(biāo)清晰如參數(shù)化齒輪。這類任務(wù)構(gòu)成基準(zhǔn)的“基礎(chǔ)分”。中間層半開放任務(wù)。有明確的功能性要求但在形式上有一定自由度。例如“創(chuàng)建一個(gè)儲(chǔ)物架至少有三層每層承重面積不小于0.5平方米整體高度在1.2米到1.8米之間。” 評(píng)估時(shí)可以自動(dòng)化檢查層數(shù)、面積、高度等硬性約束而對(duì)于美觀度、結(jié)構(gòu)細(xì)節(jié)則可以引入一些可量化的代理指標(biāo)如對(duì)稱性評(píng)分、三角形數(shù)量與質(zhì)量的比值等。挑戰(zhàn)層開放創(chuàng)意任務(wù)。定期舉辦由人類專家評(píng)分的競(jìng)賽。雖然不能完全自動(dòng)化但能為排行榜提供“頂尖高手”的區(qū)分度并收集高質(zhì)量的人類反饋數(shù)據(jù)用于訓(xùn)練更好的評(píng)估模型。5.2 評(píng)估指標(biāo)的全面性與可計(jì)算性矛盾我們希望能評(píng)估代碼的“優(yōu)雅度”、設(shè)計(jì)的“創(chuàng)意度”但這些概念難以量化。過(guò)度依賴簡(jiǎn)單的、可計(jì)算的指標(biāo)如代碼行數(shù)少、執(zhí)行速度快可能會(huì)導(dǎo)致代理為了“刷分”而產(chǎn)出怪異、不可維護(hù)的代碼或模型。對(duì)策設(shè)計(jì)復(fù)合型、防御性的指標(biāo)。反對(duì)“刷分”例如不僅獎(jiǎng)勵(lì)代碼行數(shù)少還要懲罰過(guò)高的圈復(fù)雜度Cyclomatic Complexity鼓勵(lì)適度的函數(shù)分解。對(duì)于模型不僅要看與參考模型的相似度還要檢查網(wǎng)格質(zhì)量如非流形邊、自相交、狹長(zhǎng)三角形比例。引入人類反饋對(duì)于高階評(píng)估維度建立一個(gè)小規(guī)模但高質(zhì)量的人類評(píng)估者隊(duì)伍。他們的評(píng)分可以作為“黃金標(biāo)準(zhǔn)”用于校準(zhǔn)和訓(xùn)練自動(dòng)評(píng)估模型。例如可以訓(xùn)練一個(gè)神經(jīng)網(wǎng)絡(luò)來(lái)預(yù)測(cè)一段3D建模代碼在可讀性上能獲得的人類評(píng)分。重視“過(guò)程”日志在執(zhí)行代碼時(shí)除了捕獲最終模型還可以記錄關(guān)鍵的API調(diào)用序列、中間生成的幾何體快照。分析這些“過(guò)程數(shù)據(jù)”可以判斷代理是采用了合理的、分步的構(gòu)建邏輯還是用了一些取巧的、非常規(guī)的“黑魔法”。5.3 執(zhí)行環(huán)境的安全性與可控性運(yùn)行不受信任的AI生成代碼是危險(xiǎn)的。代碼可能包含無(wú)限循環(huán)、嘗試訪問(wèn)文件系統(tǒng)、進(jìn)行網(wǎng)絡(luò)調(diào)用甚至含有惡意指令。對(duì)策構(gòu)建強(qiáng)隔離的沙箱環(huán)境。容器化使用Docker或類似技術(shù)每個(gè)任務(wù)的代碼都在一個(gè)全新的、網(wǎng)絡(luò)隔離的容器中運(yùn)行。容器資源CPU、內(nèi)存、運(yùn)行時(shí)間受到嚴(yán)格限制。API白名單在Blender的Python環(huán)境中可以通過(guò)猴子補(bǔ)丁monkey-patching或自定義的受限執(zhí)行環(huán)境禁用危險(xiǎn)的模塊如os.system,subprocess,requests只暴露允許使用的bpy等API。系統(tǒng)調(diào)用攔截在操作系統(tǒng)層面可以使用seccomp-bpf等工具來(lái)限制容器內(nèi)進(jìn)程可以執(zhí)行的系統(tǒng)調(diào)用從根本上杜絕危險(xiǎn)操作。5.4 基準(zhǔn)的長(zhǎng)期維護(hù)與社區(qū)生態(tài)一個(gè)基準(zhǔn)如果缺乏維護(hù)任務(wù)過(guò)時(shí)、環(huán)境失效很快就會(huì)失去價(jià)值。如何吸引社區(qū)貢獻(xiàn)任務(wù)、工具和解決方案是項(xiàng)目成功的關(guān)鍵。對(duì)策開源、模塊化、提供便捷的參與路徑。完全開源將基準(zhǔn)的任務(wù)定義、評(píng)估腳本、執(zhí)行環(huán)境Dockerfile全部開源。清晰的貢獻(xiàn)指南提供模板讓社區(qū)可以輕松提交新的任務(wù)提案。設(shè)立審核機(jī)制確保新任務(wù)的質(zhì)量和評(píng)估可行性。定期更新與挑戰(zhàn)賽像許多AI競(jìng)賽平臺(tái)一樣定期發(fā)布新任務(wù)、舉辦挑戰(zhàn)賽并維護(hù)一個(gè)公開的排行榜吸引研究機(jī)構(gòu)和公司的參與。提供基線模型與工具提供一些簡(jiǎn)單的基線代理例如基于GPT-4的簡(jiǎn)單提示工程和可視化調(diào)試工具降低社區(qū)的使用門檻讓大家能快速上手并在此基礎(chǔ)上進(jìn)行改進(jìn)。6. 對(duì)AI與3D建模領(lǐng)域未來(lái)的啟示3DCodeBench這類基準(zhǔn)的出現(xiàn)不僅僅是多了一個(gè)評(píng)測(cè)工具它更預(yù)示著3D內(nèi)容創(chuàng)作范式可能發(fā)生的深刻變革。首先它明確了“AI作為創(chuàng)造者伙伴”的新定位。未來(lái)的3D設(shè)計(jì)師可能不再需要精通每一個(gè)建模軟件的復(fù)雜菜單。他們可以用自然語(yǔ)言描述需求由AI代理負(fù)責(zé)將需求轉(zhuǎn)化為精確的、可編輯的程序化代碼。設(shè)計(jì)師的角色將更側(cè)重于概念提出、審美把控和參數(shù)調(diào)整而將重復(fù)性、技術(shù)性的實(shí)現(xiàn)工作交給AI。這大大降低了專業(yè)3D創(chuàng)作的門檻。其次它推動(dòng)了“代碼即資產(chǎn)”的理念。在程序化建模中一段健壯、參數(shù)化、可讀性高的代碼其價(jià)值遠(yuǎn)高于它某一次運(yùn)行生成的靜態(tài)模型。這段代碼是一個(gè)活的模板可以快速衍生出無(wú)數(shù)變體。3DCodeBench通過(guò)評(píng)估代碼質(zhì)量正是在鼓勵(lì)和認(rèn)可這種資產(chǎn)的價(jià)值。未來(lái)的3D資產(chǎn)庫(kù)可能不僅包含.obj、.fbx文件還會(huì)包含大量生成這些模型的.py腳本。最后它為更通用的“具身AI”和“機(jī)器人任務(wù)規(guī)劃”提供了預(yù)演。用代碼生成3D模型本質(zhì)上是一個(gè)“規(guī)劃-執(zhí)行”的過(guò)程理解目標(biāo)任務(wù)描述、規(guī)劃步驟代碼邏輯、調(diào)用工具API、驗(yàn)證結(jié)果。這與讓一個(gè)機(jī)器人完成“清理桌子”或“組裝家具”在邏輯上是相通的。在安全的虛擬3D環(huán)境中訓(xùn)練和評(píng)估AI的規(guī)劃與執(zhí)行能力成本遠(yuǎn)低于物理世界。因此3DCodeBench所積累的方法論——如何定義任務(wù)、如何評(píng)估過(guò)程和結(jié)果——很可能為更廣泛的AI智能體研究提供寶貴的借鑒。從我個(gè)人的開發(fā)經(jīng)驗(yàn)來(lái)看著手構(gòu)建或參與這樣一個(gè)基準(zhǔn)項(xiàng)目哪怕是從我們上面演示的極簡(jiǎn)版本開始也是一個(gè)極具價(jià)值的學(xué)習(xí)過(guò)程。它會(huì)迫使你深入思考3D建模的本質(zhì)、程序設(shè)計(jì)的優(yōu)劣以及如何將模糊的人類創(chuàng)意轉(zhuǎn)化為可評(píng)估的機(jī)器指令。這個(gè)過(guò)程本身就是對(duì)未來(lái)人機(jī)協(xié)作創(chuàng)作模式的一次深刻洞察。