我們開源了一套讓 LLM 真正“學(xué)會思考”的方法論
Agentic Method—— 不是更多的 prompt而是一套讓模型輸出更可觀測、可證偽、可進(jìn)化的工作流。GitHub: https://github.com/Ghost-Silver/Agentic-Method一個越來越明顯的問題現(xiàn)在的 LLM尤其是中檔模型指令遵循能力已經(jīng)很強(qiáng)了。你讓它按格式輸出、按步驟執(zhí)行、調(diào)用工具它基本都能做到。但一到復(fù)雜任務(wù)——比如審查一個多文件代碼改動、設(shè)計一組對照實驗、或者推理一個系統(tǒng) bug 的根因——模型就開始出現(xiàn)兩種典型失敗幻覺自信地給出沒有依據(jù)的結(jié)論。事后合理化先跳到一個答案再編造一個看似合理的推理過程fake CoT。這些不是模型“不夠聰明”而是模型的解碼空間太大沒有足夠的外部約束把它錨定在“正確思考”的軌道上。我們的思路用方法論約束解碼空間我們開源的Agentic Method本質(zhì)上不是一套“提示詞合集”而是一套元工作流meta-workflow。它通過四個機(jī)制把模型的思考過程外化、結(jié)構(gòu)化、可審計1. 嚴(yán)格 DSL 錨定用類似(CTX)、(H)、(PREDICTION)、(OBSERVATION)、(VERDICT)的標(biāo)簽強(qiáng)制模型在每個關(guān)鍵節(jié)點聲明當(dāng)前上下文是什么假設(shè)是什么可證偽的預(yù)測是什么實際觀測到了什么最終裁決是什么這能把模型的輸出從“自由作文”變成“結(jié)構(gòu)化科研記錄”顯著降低幻覺。2. 強(qiáng)制深層推理每個關(guān)鍵結(jié)論必須附帶證據(jù)等級F0-F4置信度(CONF: level, 證據(jù)統(tǒng)計)至少一個競爭假設(shè)(BRANCH)明確的證偽條件(FALSIFICATION)模型不能再停留在表面回答。3. 子 Agent 交叉審查通過FORM_REVIEWER、HYPOTHESIS_VALIDATOR、COUNTEREXAMPLE_REVIEWER等角色讓不同 Agent 互相挑錯。循環(huán)論證、隱藏假設(shè)、事后合理化會被顯式標(biāo)記出來。4. 引入科研方法二分、消融、對照、反事實推理——這些方法不是作為“建議”寫在文檔里而是作為不可跳過的步驟嵌入 prompt。30 個核心 prompt覆蓋高風(fēng)險任務(wù)倉庫里包含了 30 個已經(jīng)脫敏、可直接復(fù)用的核心 promptexperimental-design-prompt.md設(shè)計可驗證的實驗logical-inference-prompt.md嚴(yán)格邏輯推理與證明審查code-review-prompt.md系統(tǒng)性代碼審查debug-prompt.md因果排查與修復(fù)performance-optimization-prompt.md性能優(yōu)化決策prompt-evolution-prompt.md讓 prompt 自己進(jìn)化自己subagent-protocol.md18 個子 Agent 角色的協(xié)作協(xié)議……以及更多所有 prompt 都遵循同一套 DSL可以按需加載、組合、演化。Prompt 自動進(jìn)化PEL最有意思的部分可能是Prompt Evolution LoopPEL。它的思路很簡單對同一個種子 prompt自動生成多個變異版本用同一組真實任務(wù)并行評測然后保留適應(yīng)度最高的變體。我們已經(jīng)在示例報告中展示了一次真實的 PEL 運(yùn)行結(jié)果CONSTRAINT_ADD算子修復(fù)了一個 P0 級協(xié)議一致性缺陷ANTI_PATTERN_BLOCK算子因為與既有規(guī)則矛盾而被廢棄EXAMPLE_INJECT算子需要與清單化調(diào)用點結(jié)合才有效。這些結(jié)論本身就是 prompt 工程從“玄學(xué)”走向“可實驗科學(xué)”的證據(jù)。推薦配置這套方法論是為了高風(fēng)險任務(wù)設(shè)計的會消耗更多 token 和上下文。但我們認(rèn)為值得。主 Agent / 編排層推薦 200B、200K 上下文的強(qiáng)模型子 Agent / 審查層可以用更便宜的中等模型運(yùn)行方式先讀main.md再按需加載對應(yīng) prompt。適用場景復(fù)雜代碼審查與架構(gòu)決策Bug 根因排查性能優(yōu)化實驗設(shè)計科研論證與技術(shù)調(diào)研任何“說錯一句話代價很高”的任務(wù)開源MIT 協(xié)議我們希望這套方法能被更多人驗證、改進(jìn)、應(yīng)用到不同領(lǐng)域。如果你成功把它用到了軟件工程或科研之外的領(lǐng)域用 PEL 進(jìn)化出了更好的 prompt 變體發(fā)現(xiàn)了某個 prompt 的漏洞歡迎在 GitHub 上開 Issue 或 PR。社區(qū)會一起積累更多領(lǐng)域的 adapter 和最佳實踐。下一步打開倉庫https://github.com/Ghost-Silver/Agentic-Method從core/master-prompt.md開始讀選一個你正在頭疼的復(fù)雜任務(wù)試試experimental-design-prompt.md或debug-prompt.md如果有效回來點個 ?或者分享你的使用案例這不是又一個 prompt 倉庫。這是一套讓 LLM 學(xué)會像科研人員一樣思考的工作流。https://github.com/Ghost-Silver/Agentic-Method

相關(guān)新聞

Python生成器原理與應(yīng)用:從yield到內(nèi)存優(yōu)化

Python生成器原理與應(yīng)用:從yield到內(nèi)存優(yōu)化

1. 從函數(shù)到生成器的跨越第一次遇到y(tǒng)ield關(guān)鍵字時,我正嘗試處理一個超過10GB的日志文件。傳統(tǒng)方法是將整個文件讀入內(nèi)存,結(jié)果自然是內(nèi)存溢出。同事建議我試試生成器,從此打開了新世界的大門。yield是Python中一個神奇的關(guān)鍵字,它能…

2026/7/30 3:51:46 閱讀更多
Python護(hù)工管理系統(tǒng):醫(yī)療行業(yè)的智能排班與任務(wù)追蹤解決方案

Python護(hù)工管理系統(tǒng):醫(yī)療行業(yè)的智能排班與任務(wù)追蹤解決方案

1. 項目概述:護(hù)工管理系統(tǒng)的現(xiàn)實需求與技術(shù)選型在醫(yī)療護(hù)理行業(yè),護(hù)工資源的高效管理一直是機(jī)構(gòu)運(yùn)營的痛點。傳統(tǒng)紙質(zhì)排班表、Excel表格管理的方式,在面對突發(fā)調(diào)班、緊急任務(wù)分配時往往捉襟見肘。我曾參與過某三甲醫(yī)院的護(hù)工管理優(yōu)化項目&#…

2026/7/30 3:41:46 閱讀更多
國產(chǎn)長芯微LDC7124-8 替代 AD7124-8 參數(shù)對比分析

國產(chǎn)長芯微LDC7124-8 替代 AD7124-8 參數(shù)對比分析

描述LDC7124-8是一款適合高精度測量應(yīng)用的低功耗、低噪聲、高度集成的模擬前端。該器件內(nèi)置一個低噪聲24位Σ-Δ型模數(shù)轉(zhuǎn)換器(ADC),可通過寄存器配置提供8個差分輸入或15個單端或偽差分輸入。LDC7124-4可以提供4對差分輸入或者7個單端或偽差分輸入。片內(nèi)低噪聲增益放…

2026/7/30 6:01:52 閱讀更多
Elasticsearch在電商推薦系統(tǒng)中的應(yīng)用與優(yōu)化

Elasticsearch在電商推薦系統(tǒng)中的應(yīng)用與優(yōu)化

1. 分布式商品推薦系統(tǒng)的架構(gòu)挑戰(zhàn)在電商平臺的實際運(yùn)營中,商品推薦系統(tǒng)面臨著三個核心難題:首先是如何處理海量商品數(shù)據(jù)的實時檢索,其次是保證高并發(fā)用戶請求下的系統(tǒng)響應(yīng)速度,最后是確保推薦結(jié)果的精準(zhǔn)度。傳統(tǒng)單體架構(gòu)在應(yīng)對這些…

2026/7/30 6:01:52 閱讀更多
[GESP202606 四級] 掃雷

[GESP202606 四級] 掃雷

B4557 [GESP202606 四級] 掃雷 https://www.luogu.com.cn/problem/B4557 中國計算機(jī)學(xué)會(CCF)2026年6月C四級講解——掃雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四級] 掃雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:01:06 閱讀更多