景!馬里蘭大學(xué)等提出LEGO-Anything)
LEGO-Anything: Coding Agents for 3D Scene Reconstruction作者Xirui Li, Peng Shi, Mingwen Dong, Sheng Zhang, Zhuoyan Xu, Dongkyu Lee, Shuaichen Chang, Yi Xiang, Lin Pan, Jiarong Jiang核心發(fā)表機(jī)構(gòu)University of Maryland, College Park、AWS論文鏈接arXiv:2609.36380v1發(fā)布于arXiv 預(yù)印本cs.CV|————————|GPT-6-astra Codex | 100.0±0.0 | 52.4±1.1 | 54.4±0.7 |53.4±0.8| 98.0±1.0 | 34.0±1.5 | 45.5±0.5 |39.6±0.8||GPT-6-sol Codex | 99.4±1.1 | 22.2±2.4 | 42.5±0.3 | 32.3±1.0 | 99.7±0.6 | 19.8±1.0 | 28.7±0.5 | 24.2±0.4 ||GPT-6-luna Codex | 99.7±0.5 | 15.8±1.2 | 30.5±0.3 | 23.2±0.7 | 99.7±0.6 | 13.2±0.6 | 21.4±0.5 | 17.3±0.5 ||GPT-5.6-sol Codex | 97.8±2.3 | 9.8±2.1 | 19.8±0.6 | 14.8±1.0 | 98.7±0.6 | 12.8±1.8 | 17.7±0.4 | 15.3±0.8 ||GPT-5.6-terra Codex | 99.7±0.5 | 9.5±1.0 | 21.3±0.5 | 15.4±0.6 | 98.0±1.7 | 8.1±0.7 | 15.0±0.9 | 11.5±0.4 ||GPT-5.6-luna Codex | 99.1±0.0 | 10.2±2.1 | 18.0±0.7 | 14.1±1.3 | 97.0±1.0 | 7.8±1.5 | 16.6±0.8 | 12.1±1.0 |基線結(jié)果如下其中 “–” 表示論文設(shè)置下未報(bào)告該 split?;€Indoor VIndoor RIndoor AIndoor SOutdoor VOutdoor ROutdoor AOutdoor SVIGA100.0±0.010.8±1.520.3±0.715.6±1.1100.0±0.08.0±0.417.1±0.012.6±0.2SceneConductor12.3±2.35.0±2.10.0±0.00.3±0.2––––3D-RE-GEN100.0±0.01.2±0.111.3±0.26.3±0.1––––Gen3DSR92.0±1.165.4±0.70.0±0.030.1±0.480.0±1.035.0±0.50.0±0.014.0±0.1REST3D77.5±13.07.2±0.70.0±0.02.8±0.4––––SceneGen71.6±3.09.7±1.80.0±0.03.4±0.538.7±1.52.6±1.10.0±0.00.5±0.2主要發(fā)現(xiàn)是所有六個(gè) GPT 配置的 Validity 接近飽和但保真度差異很大總體分?jǐn)?shù)從GPT-6-astra的 53.4%/39.6% 到最強(qiáng)GPT-5.6配置的 15.4%/15.3%。GPT-6-astra取得最佳總體分?jǐn)?shù)超過(guò) task-specific 與 single-image scene-construction 基線。Gen3DSR 的 Reconstruction 高于GPT-6-astra室內(nèi) 65.4% vs. 52.4%但其 Appearance 無(wú)法評(píng)估0.0%。VIGA 和 3D-RE-GEN 能交付有效 artifact但保真度低。六個(gè)基線中有三個(gè)不支持 outdoor 場(chǎng)景而所有編碼智能體都能在 indoor/outdoor 兩個(gè) split 上運(yùn)行Validity 穩(wěn)定盡管所有模型在 outdoor 上保真度下降。核心結(jié)論是編碼智能體能夠穩(wěn)定交付有效 artifact但 artifact delivery 與忠實(shí)場(chǎng)景重建之間仍存在明顯差距。成本–性能方面論文用標(biāo)準(zhǔn)化 token 成本代理作為橫軸benchmark 全域、經(jīng) artifact 有效性門控的 Final 分?jǐn)?shù)作為縱軸虛線連接非支配前沿。GPT-5.6-luna是絕對(duì)最便宜的點(diǎn)但質(zhì)量–成本前沿的大部分由 GPT-6 家族定義GPT-6-luna相對(duì)最低成本區(qū)間顯著提升GPT-6-sol以中等成本再添一檔質(zhì)量GPT-6-astra以顯著更高花費(fèi)達(dá)到最高分。GPT-5.6-sol與GPT-5.6-terra位于前沿之外。Bird’s-Eye 重建壓力測(cè)試單獨(dú)報(bào)告在非配對(duì)的 NYC Bird’s-Eye split 上每次完整運(yùn)行含 10 個(gè)俯視視圖 case該表報(bào)告三個(gè) GPT-6 agent 的 artifact validity、Reconstruction F2%、Appearance 與有效性門控 Final 分?jǐn)?shù)。Model HarnessV ↑R ↑A ↑S ↑GPT-5.6-solCodex93.3 ± 5.811.2 ± 7.924.3 ± 3.316.4 ± 3.6GPT-5.6-terraCodex86.7 ± 5.80.9 ± 1.323.0 ± 4.210.7 ± 2.8GPT-5.6-lunaCodex80.0 ± 10.07.6 ± 6.021.1 ± 2.911.4 ± 2.8GPT-6-astraCodex100.0 ± 0.024.0 ± 5.046.6 ± 0.335.3 ± 2.5GPT-6-solCodex100.0 ± 0.017.8 ± 2.640.0 ± 0.828.9 ± 1.0GPT-6-lunaCodex100.0 ± 0.06.7 ± 4.734.4 ± 0.720.0 ± 2.7結(jié)論是GPT-6-astra在 Bird’s-Eye 壓力測(cè)試中最強(qiáng)GPT-6 家族顯著優(yōu)于 GPT-5.6 家族但所有模型在 artifact 交付與遠(yuǎn)更弱的嚴(yán)格幾何重建F2%之間仍存在明顯差距。LEGO-World 測(cè)試重建場(chǎng)景能否表示自然圖像。實(shí)驗(yàn)用未啟用 LEGO-Plugin 的GPT-6-astra在三條固定 100 圖像軌跡上評(píng)測(cè)COCO val2017 檢測(cè)、LVIS v1 驗(yàn)證集實(shí)例分割、ETH3D 相對(duì)深度。agent 先構(gòu)建場(chǎng)景然后從凍結(jié) artifact 讀取任務(wù)預(yù)測(cè)。由于場(chǎng)景導(dǎo)出沒(méi)有校準(zhǔn)置信度box 和 mask AP 遵循 equal-confidence protocol即把每個(gè)預(yù)測(cè)實(shí)例的置信度統(tǒng)一設(shè)為 1.0并使用確定性并列順序缺失的場(chǎng)景預(yù)測(cè)導(dǎo)出為“無(wú)檢測(cè)”而不是丟棄該圖像。結(jié)果如下方法Box APMask APAbsRelScene readoutsGPT-6-astra 重建30.114.80.155專用模型DINO: 59.9SAM 3: 54.0Depth Anything 3: 0.078場(chǎng)景 readouts 在三個(gè)任務(wù)上均達(dá)到非平凡性能檢測(cè)達(dá)到專用模型 box AP 的約一半但遠(yuǎn)低于專用視覺(jué)模型。當(dāng)前編碼智能體通過(guò)程序構(gòu)建的場(chǎng)景是自然圖像的有前景但尚不夠精確的表示。覆蓋率方面COCO boxes 與 LVIS masks 各嘗試 100 張圖像有計(jì)分的場(chǎng)景輸出為 94 張匹配診斷配對(duì)為 93 對(duì)ETH3D depth 嘗試 100 張有計(jì)分場(chǎng)景輸出 99 張匹配診斷配對(duì) 99 對(duì)。在相同的 99 張有效圖像上歸檔直接法與場(chǎng)景式的 AbsRel 均值分別為 0.07845 與 0.15540。4.3 消融實(shí)驗(yàn) / Ablation Study場(chǎng)景復(fù)雜度的影響。論文在 Easy/Medium/Hard 三檔下報(bào)告 R 與 A對(duì)所有GPT-6與GPT-5.6配置平均。Indoor 的 R 從 23.3±0.1 降到 19.7±1.2 再到 18.8±0.4A 從 30.4±0.6 降到 27.9±0.6 再到 27.4±0.5Outdoor 的 R 從 18.4±0.9 降到 14.2±1.0 再到 12.7±1.0A 從 25.3±0.4 降到 22.8±0.9 再到 22.4±0.3。場(chǎng)景復(fù)雜度增加主要降低保真度而非可執(zhí)行性Validity 在各 tier 穩(wěn)定在 99.5%??傮w分?jǐn)?shù)從 Easy 的 24.6% 降到 Medium 的 21.3%再到 Hard 的 20.5%。下降最陡的是 outdoor Reconstruction18.4% → 12.7%。Outdoor 場(chǎng)景在每個(gè)復(fù)雜度層級(jí)都比 indoor 更難。更多推理是否改善場(chǎng)景重建。論文在固定的 42-case Office 子集上做 test-time scaling變化 harness-native reasoning effortLow、Medium、High、XHigh同時(shí)保持輸入、prompts、執(zhí)行預(yù)算和評(píng)分固定。三個(gè)GPT-6模型的 overall score 隨 effort 上升astra從 32.3% 到 61.8%sol從 21.3% 到 39.7%luna從 14.4% 到 21.2%。增益隨模型強(qiáng)度增大而增大astra在接近 XHigh 時(shí)飽和而sol繼續(xù)改善。相比之下GPT-5.6模型顯示出微弱或非單調(diào)變化。該 campaign 覆蓋 6 模型 × 4 檔 effort × 42 任務(wù)共 1,008 個(gè)結(jié)果全部用同一個(gè)凍結(jié)評(píng)估器與同一容器鏡像重新打分圖中區(qū)間是 42 個(gè)任務(wù)輸入上均值的 pointwise 95% percentile bootstrap 區(qū)間10,000 次重采樣它們不度量重復(fù)運(yùn)行間的波動(dòng)。新增的GPT-6-sol與GPT-6-luna掃描貢獻(xiàn) 336 個(gè)結(jié)果其 High 結(jié)果專為該掃描生成提示禁用了主表 campaign 中使用的額外相機(jī)引導(dǎo)13 個(gè) Luna 試驗(yàn)保留原生非零退出標(biāo)志但 artifact 被成功重新打分這些結(jié)果保留在固定分母中。LEGO-Plugin 的消融與定性結(jié)果。插件在 42-case Office 子集上評(píng)估比較每個(gè)模型有/無(wú)插件保持相同輸入、prompts、執(zhí)行預(yù)算、reasoning effort 和 evaluator插件只看到參考圖像和當(dāng)前 Blender 場(chǎng)景從不看私有 ground truth 或 LEGO-Bench 分?jǐn)?shù)。LEGO-Plugin 改善全部六個(gè)模型增益與基礎(chǔ)性能負(fù)相關(guān)三個(gè)GPT-5.6模型相對(duì)改善 55%–63%約 7–8 個(gè)點(diǎn)GPT-6-luna相對(duì)改善 27.5%GPT-6-sol相對(duì)改善 12.1%GPT-6-astra僅 2.1%。摘要給出的最高相對(duì)增益為 62.7%。這一模式表明插件主要補(bǔ)償較弱智能體表現(xiàn)出的初始化、回歸和自評(píng)估失敗最強(qiáng)智能體已經(jīng)避免了其中大部分問(wèn)題。定性例子方面Reception 場(chǎng)景中相對(duì)于三個(gè)GPT-5.6-solbase runs 的最佳結(jié)果LEGO-Plugin 更好匹配參考總體分?jǐn)?shù)從 0.147 提升到 0.325。下面依次給出該例的參考圖、base 結(jié)果與插件結(jié)果。Copy room 場(chǎng)景中總體分?jǐn)?shù)從 0.109 提升到 0.278。下面依次給出該例的參考圖、base 結(jié)果與插件結(jié)果。結(jié)論是LEGO-Plugin 無(wú)需訓(xùn)練即可改善每個(gè)模型對(duì)較弱智能體增益最大縮小了但與最強(qiáng)模型的差距仍未閉合。軌跡診斷。論文分析GPT-6-astra、GPT-5.6-sol、GPT-5.6-terra、GPT-5.6-luna的首次歸檔原生高推理努力運(yùn)行每個(gè) cohort 目標(biāo)為 198 個(gè) Indoor/Outdoor 任務(wù)排除 10 個(gè) Bird’s-Eye 任務(wù)。合格 checkpoint 需有合法 Blender 場(chǎng)景、幾何導(dǎo)出以及 Reconstruction 與 Appearance 兩個(gè)分?jǐn)?shù)checkpoint 質(zhì)量Q ( R A ) / 2 Q(RA)/2Q(RA)/2離線計(jì)算且從不暴露給 actor。下圖匯總共同任務(wù)交集上的首場(chǎng)景時(shí)間、軌跡回歸與最終 regret。GPT-6-astra在絕對(duì)墻鐘時(shí)間上更晚到達(dá)首個(gè)可評(píng)測(cè)場(chǎng)景但相對(duì)自身運(yùn)行時(shí)長(zhǎng)更早且具有最低的回歸率與最好的 best-to-final regret。四個(gè)模型的構(gòu)建過(guò)程都是非單調(diào)的因此最終提交應(yīng)被解讀為軌跡端點(diǎn)而非有保證的最優(yōu)狀態(tài)。此前分析還顯示GPT-5.6-sol常停滯或下降29.6% 的編輯降低分?jǐn)?shù)最終提交比最佳中間場(chǎng)景低 3.2 分這些回歸來(lái)自后續(xù)編輯破壞幾何、相機(jī)設(shè)置或之前更強(qiáng)的場(chǎng)景。編碼智能體能否判斷自己的場(chǎng)景。論文用 VLM judge 測(cè)試方法給定同一 case 的兩張渲染圖judge model 選擇更好的一張測(cè)量其與確定性 LEGO-Bench 指標(biāo)方向的一致性chance 50%。在六個(gè)模型的全部 36 個(gè) builder–judge 對(duì)中self-judgments 在 Reconstruction 上一致率為 45.8%Appearance 上為 62.2%cross-model judgments 在 Reconstruction 上為 45.4%Appearance 上為 63.9%。在幾何上judge 接近或低于 chanceself-judging 優(yōu)于其他五個(gè) judge 的均值僅出現(xiàn)在 3/6 buildersReconstruction和 2/6 buildersAppearance。VLM judge 設(shè)置中比較共含 360 個(gè) checkpoint 對(duì)來(lái)自完整6 × 6 6\times66×6矩陣的 2,160 條主判定終局失敗為 0額外有 36 對(duì)被每個(gè) judge 以反序評(píng)估得到 216 條審計(jì)判定順序交換一致性 Reconstruction 為 69.4%–100.0%Appearance 為 61.1%–83.3%。核心結(jié)論是編碼智能體不能可靠判斷場(chǎng)景質(zhì)量尤其是幾何self-judging 相比 cross-model judging 沒(méi)有一致優(yōu)勢(shì)。因此 refinement 應(yīng)基于 deterministic evidence而非自我評(píng)估。敏感性檢查與鉸接試點(diǎn)。小規(guī)模敏感性檢查固定六個(gè)任務(wù)子集由 GPT-6-astra 與 GPT-5.6-sol 共享。改變重建閾值F2%、F5%、F10%、外觀容差20、30、40和點(diǎn)預(yù)算25k、50k、100k會(huì)按預(yù)期改變絕對(duì)值但不會(huì)改變?cè)撟蛹系哪P团判騁PT-6-astra 始終領(lǐng)先 GPT-5.6-sol。鉸接試點(diǎn)方面論文使用 canonical articulation registry443 個(gè)規(guī)范資產(chǎn)中36883.1%確認(rèn)為靜態(tài)7516.9%具有驗(yàn)證的關(guān)節(jié)關(guān)節(jié)要求 327 個(gè)其中連續(xù) 75、旋轉(zhuǎn) 55、棱柱 197GT 不可用為 0。在重評(píng)一個(gè)凍結(jié)的 Office 提交時(shí)此前部分 GT 適配器下只有 2 個(gè)鉸接目標(biāo)可計(jì)分、12 個(gè)不可用完整 canonical manifest 使全部 14 個(gè)鉸接目標(biāo)可計(jì)分并保留 12 個(gè)人工確認(rèn)的靜態(tài)目標(biāo)作為誤運(yùn)動(dòng)對(duì)照把不可用計(jì)數(shù)降到零。該提交仍然得到S A r t p i l o t 0 S_{\mathrm{Art}}^{\mathrm{pilot}}0SArtpilot?0故這個(gè)零反映的是預(yù)測(cè)本身而非鉸接真值缺失??尚械膱?chǎng)景級(jí)鉸接評(píng)估仍需要更具體的場(chǎng)景設(shè)定有待進(jìn)一步探索。五、相關(guān)工作 / Related Work編碼智能體。編碼智能體可被理解為 LLM 加代碼編輯、執(zhí)行與迭代驗(yàn)證的工具組合其 harness 組織工具訪問(wèn)、執(zhí)行上下文與環(huán)境反饋使代碼既是輸出也是規(guī)劃與交互的接口。論文點(diǎn)名的相關(guān)工作包括 VIGA通過(guò) code–render–inspect 循環(huán)重建并編輯視覺(jué)程序、SEIG通過(guò) staged executable inverse graphics 把圖像重建為可編輯 Blender 程序、ArtiCraft面向鉸接式 3D 資產(chǎn)的 agentic coding 接口、Code-CoT把可執(zhí)行 3D 程序作為空間推理的中間表示等。LEGO-Anything 的差異在于它把通用編碼智能體本身作為“單圖可執(zhí)行場(chǎng)景構(gòu)建”的 testbed重點(diǎn)關(guān)注場(chǎng)景保真度、迭代失敗模式以及凍結(jié)重建場(chǎng)景的感知充分性。附錄還提到 LL3M它用多個(gè)語(yǔ)言模型 agent 編寫(xiě)、調(diào)試、精修 Blender Python 腳本用于 3D 建模LEGO-Anything 的區(qū)別在于任務(wù)與評(píng)測(cè)目標(biāo)但源碼筆記中該句在“it evaluates end-to-end image-conditioned scene”處截?cái)嗪罄m(xù)內(nèi)容未提供因此不對(duì)其完整對(duì)比作額外推斷。3D 場(chǎng)景構(gòu)建。程序化系統(tǒng)從結(jié)構(gòu)化規(guī)格與可復(fù)用資產(chǎn)生成自然、室內(nèi)或城市環(huán)境例如 ProcTHOR、Infinigen、Infinigen Indoors、CityCraft。圖像條件方法從視覺(jué)觀測(cè)恢復(fù)幾何與外觀例如 collaborative multimodal coding、SAM3D 系。其他方向包括從 RGB-D 掃描得到可編輯室內(nèi)場(chǎng)景以及 simulation-ready 鉸接資產(chǎn)例如 Ditto、PARIS、URDF-Anything、SimArt、Articulate-Anything、PhysX-Anything 等。這些工作提供越來(lái)越強(qiáng)的組件但沒(méi)有直接回答“單張自然圖像能否被重建為忠實(shí)的可執(zhí)行場(chǎng)景”。物體級(jí) image-to-3D 代表如 TriMM、SAM 3D、LiteReality 提供日益強(qiáng)大的幾何與外觀先驗(yàn)可作為更大場(chǎng)景構(gòu)建流水線的組件但重建孤立物體本身并不決定多個(gè)物體應(yīng)如何被選擇、定位、鉸接與整合進(jìn)連貫的可執(zhí)行場(chǎng)景。鉸接與仿真兼容資產(chǎn)方向與本文互補(bǔ)它們強(qiáng)化物體級(jí)幾何、外觀與功能而 LEGO-Anything 評(píng)測(cè)的是完整可執(zhí)行場(chǎng)景的圖像條件裝配。場(chǎng)景重建與可編輯 3D 中間表示。Panoptic 3D scene reconstruction from a single RGB image 在固定場(chǎng)景表示中聯(lián)合推理幾何、語(yǔ)義與實(shí)例RecGen 通過(guò)生成式框架從稀疏 RGB-D 觀測(cè)重建多物體場(chǎng)景直接處理不完整視圖下的歧義、遮擋與不確定性。與 LEGO-Anything 的差別在輸出接口本文問(wèn)的是通用編碼 agent 能否從單張 RGB 圖像產(chǎn)出可執(zhí)行 Blender 場(chǎng)景程序而不是預(yù)測(cè)固定的 panoptic 或生成式場(chǎng)景表示??删庉?3D 中間表示也用于重建之外BlenderFusion 用 3D-grounded Blender 場(chǎng)景做視覺(jué)編輯與生成式合成表明顯式場(chǎng)景狀態(tài)、相機(jī)控制與物體操控可支持圖像條件視覺(jué)任務(wù)這與 LEGO-World 的動(dòng)機(jī)相鄰——可執(zhí)行場(chǎng)景不僅是重建產(chǎn)物也是可被查詢、編輯、復(fù)用的可檢視表示?;鶞?zhǔn)對(duì)比。下表比較相關(guān) 3D 基準(zhǔn)? 表示支持? 表示不支持。BenchmarkImage InputScene-level Eval.Executable / InteractiveIndoor/Outdoor CoverageNatural-Image StyleControlled Difficulty3DCodeBench??????WorldCoder-Bench??????P3D-Bench??????SEIG??????SceneActBench??????LEGO-Bench(Ours)??????LEGO-Bench 獨(dú)特地針對(duì)端到端評(píng)估可執(zhí)行場(chǎng)景重建跨多樣、現(xiàn)實(shí)場(chǎng)景具有受控難度。評(píng)估基礎(chǔ)設(shè)施與可復(fù)現(xiàn)性。論文基于 Harbor 完成任務(wù)擴(kuò)展、重復(fù)、日志、產(chǎn)物收集、verifier 執(zhí)行與聚合自研l(wèi)ego_bench_harbor包新增數(shù)據(jù)集轉(zhuǎn)換器、隔離的 Blender 運(yùn)行時(shí)、agent 適配器、verifier 與運(yùn)行 manifest。公開(kāi)輸入掛載給 actor而私有幾何、掩碼、深度、對(duì)應(yīng)關(guān)系保持 verifier-only。正式運(yùn)行使用隔離的 Docker/Compose 環(huán)境含 Blender 5.0.1、Xvfb每個(gè) trial 一個(gè) Blender MCP listener。每個(gè) harness 收到相同的圖像、提示、分類體系、工具接口、限制與產(chǎn)物契約。Codex 方面ContainerCodex繼承 Harbor 的 Codex 適配器在隔離的CODEX_HOME中注冊(cè) MCP 工具并附加輸入圖像最終 campaign 設(shè)置model_provideramazon-bedrock因此 GPT 家族標(biāo)識(shí)本身并不指定服務(wù)路徑。Hermes 方面包裝層使用 Harbor 的通用適配器與上游 Nous Research Hermes Agent固定于修訂aa6f77596b只有具備凍結(jié)運(yùn)行 manifest 的配置才被報(bào)告。論文明確聲明支持某適配器并不意味著該模型配置出現(xiàn)在論文中。六、局限性與展望 / Limitations Future Work論文反復(fù)強(qiáng)調(diào)的核心局限是有效性不等于保真度。當(dāng)前編碼智能體能以接近飽和的 Validity 交付合法 scene artifact但幾何與外觀的忠實(shí)恢復(fù)仍遠(yuǎn)未解決。GPT-6-astra取得最強(qiáng)總體結(jié)果室內(nèi) 53.4%、室外 39.6%但仍存在顯著差距Gen3DSR 在 Reconstruction 上更高卻無(wú)法評(píng)估 Appearance說(shuō)明單一指標(biāo)可能掩蓋不同維度的失敗。Outdoor 場(chǎng)景比 indoor 更難且場(chǎng)景復(fù)雜度增加會(huì)降低 Reconstruction 與 Appearance但不影響 Validity。下降最陡的是 outdoor Reconstruction。這意味著可執(zhí)行性相對(duì)穩(wěn)定而幾何保真度對(duì)場(chǎng)景復(fù)雜度更敏感。構(gòu)建過(guò)程本身存在系統(tǒng)性失敗。軌跡分析顯示重建質(zhì)量沿構(gòu)建軌跡非單調(diào)較弱智能體需要更長(zhǎng)時(shí)間產(chǎn)生可評(píng)估場(chǎng)景且后續(xù)編輯可能降低場(chǎng)景保真度。GPT-5.6-sol有 29.6% 的編輯降低分?jǐn)?shù)最終提交比最佳中間場(chǎng)景低 3.2 分。編碼智能體不能可靠判斷場(chǎng)景質(zhì)量尤其是幾何self-judging 相比 cross-model judging 沒(méi)有一致優(yōu)勢(shì)。因此LEGO-Plugin 的設(shè)計(jì)原則是用參考接地的確定性證據(jù)替代自由形式自我糾正但這并沒(méi)有完全彌合與最強(qiáng)模型的差距它改善所有六個(gè)模型對(duì)較弱智能體增益最大對(duì)GPT-6-astra僅 2.1% 相對(duì)改善。LEGO-World 的讀出在檢測(cè)、分割與深度上均達(dá)到非平凡性能但遠(yuǎn)低于專用視覺(jué)模型檢測(cè) 30.14 對(duì) DINO 59.88分割 14.75 對(duì) SAM 3 的 53.96深度 AbsRel 0.1554 對(duì) Depth Anything 3 的 0.0783。論文據(jù)此判斷程序構(gòu)建場(chǎng)景是自然圖像的有前景但尚不夠精確的表示。此外equal-confidence AP 不是校準(zhǔn)置信度只能讀作固定排序下的兼容性診斷相對(duì)深度使用 scale-and-shift 對(duì)齊不檢驗(yàn)絕對(duì)度量尺度缺失輸出不能按零誤差處理。Bird’s-Eye split 不是配對(duì)的 benchmark split被排除在配對(duì)復(fù)雜度分析之外僅作為更嚴(yán)格的大尺度重建壓力測(cè)試。場(chǎng)景級(jí)鉸接試點(diǎn)雖然通過(guò)完整 canonical manifest 把不可用計(jì)數(shù)降到零并使 0 分歸因于預(yù)測(cè)本身但可行的場(chǎng)景級(jí)鉸接評(píng)估仍需更具體的場(chǎng)景設(shè)定。Reasoning-effort 的區(qū)間只反映 42 個(gè)任務(wù)輸入上的均值不確定性不度量重復(fù)運(yùn)行波動(dòng)該 campaign 的耗時(shí)也不能作為推理成本的可控度量。成本–性能前沿使用標(biāo)準(zhǔn)化 token 成本代理它只是成本近似而非完整經(jīng)濟(jì)成本。未來(lái)工作可能包括提升單圖幾何與外觀保真度尤其是 outdoor 與復(fù)雜場(chǎng)景改進(jìn) harness 與插件使弱智能體也能獲得穩(wěn)定初始化與可靠 refinement研究更強(qiáng)的場(chǎng)景級(jí)鉸接表示與評(píng)測(cè)協(xié)議擴(kuò)展資產(chǎn)庫(kù)與場(chǎng)景規(guī)格使 LEGO-Bench 隨資產(chǎn)增長(zhǎng)而擴(kuò)展以及進(jìn)一步提升程序構(gòu)建場(chǎng)景作為統(tǒng)一視覺(jué)表示的精度使其在檢測(cè)、分割、深度等任務(wù)上更接近專用模型。七、總結(jié) / ConclusionLEGO-Anything 的核心貢獻(xiàn)不在于訓(xùn)練一個(gè)更強(qiáng)的 3D 重建模型而在于重新定義任務(wù)接口把單圖場(chǎng)景重建變成通用編碼智能體在 Blender 中迭代編寫(xiě)、執(zhí)行、檢查、修訂顯式場(chǎng)景程序的過(guò)程。場(chǎng)景程序可檢查、可編輯、可查詢因而比渲染圖或固定 3D 輸出更適合作為“可操作、可診斷、可復(fù)用”的重建結(jié)果。為了衡量這一設(shè)定論文提出 LEGO-Bench208 張圖像、104 個(gè)場(chǎng)景、8 個(gè)環(huán)境、17 個(gè)主題、443 個(gè)資產(chǎn)模擬器基底允許分離評(píng)分 artifact validity、visible-surface geometry 與 rendered appearance并支持受控復(fù)雜度與精確自動(dòng)評(píng)估。實(shí)驗(yàn)表明當(dāng)前編碼智能體能可靠交付有效 artifact但幾何與外觀保真度仍有限GPT-6-astra在室內(nèi)外分別達(dá)到 53.4% 與 39.6%是最強(qiáng)配置但仍與忠實(shí)重建存在顯著差距。軌跡診斷把差距歸因于弱初始化、回歸編輯與不可靠自評(píng)估進(jìn)而催生免訓(xùn)練 harness 插件 LEGO-Plugin它以 Enhanced Initialization、Grounded Refinement 與 Version Control 三個(gè)模塊改善全部六個(gè)模型最高相對(duì)增益 62.7%對(duì)較弱智能體增益更大。LEGO-World 進(jìn)一步表明凍結(jié)的重建場(chǎng)景已經(jīng)能以確定性查詢支持檢測(cè)、分割與深度讀出性能非平凡但遠(yuǎn)低于專用視覺(jué)模型??傮w而言LEGO-Anything 把可執(zhí)行場(chǎng)景程序確立為通用編碼智能體的一個(gè)可測(cè)量、可診斷、有前景的研究目標(biāo)LEGO-Bench 的可擴(kuò)展設(shè)計(jì)有望支持未來(lái)走向更忠實(shí)的圖像條件場(chǎng)景重建。原文摘要:A 3D scene reconstructed from a single image is most useful when represented not as a rendering or a fixed 3D output, but as an explicit scene program whose execution yields a scene that can be inspected, edited, and queried. We present LEGO-Anything, an Image-to-Code framework in which a coding agent iteratively writes and executes Blender code, inspects scenes and renderings, and revises the program. To evaluate end-to-end scene recovery, we introduce LEGO-Bench, a simulator-grounded benchmark with 208 images from 104 diverse indoor and outdoor scenes. LEGO-Bench separately scores artifact validity, visible-surface geometry, and rendered appearance. Its simulator-grounded design enables extensibility and precise automatic evaluation. Among evaluated agents, GPT-6-astra achieves the strongest overall results, with 53.4% indoor and 39.6% outdoor scores, yet substantial gaps remain between delivering valid scene artifacts and faithfully recovering scene geometry and appearance. Analysis of agent construction trajectories reveals three recurring issues: weak scene initialization, regressive edits during iteration, and unreliable self-evaluation. These findings motivate LEGO-Plugin, a training-free harness plugin for more controlled iterative scene construction, which improves all six evaluated models, with relative gains of up to 62.7% in overall score. Finally, we test whether reconstructed scenes can represent natural images and support vision tasks. In LEGO-World, we derive object detections, instance masks, and relative depth as deterministic queries on scenes reconstructed by GPT-6-astra. These readouts show non-trivial performance across all three tasks but fall well short of specialized vision models, suggesting that program-constructed scenes from current coding agents are a promising but not yet sufficiently precise representation of natural images.PDF鏈接:https://arxiv.org/pdf/2609.36380v1部分平臺(tái)可能圖片顯示異常請(qǐng)以我的博客內(nèi)容為準(zhǔn)