用實(shí)踐)
1. 從“無(wú)稽之談”到現(xiàn)實(shí)一篇舊PPT如何點(diǎn)破AI推理的核心五年前當(dāng)一位MIT教授將一份關(guān)于AI未來(lái)發(fā)展的PPT斥為“無(wú)稽之談”時(shí)恐怕沒(méi)人能想到這份材料里的核心思路會(huì)成為今天OpenAI o1、o3這類(lèi)“推理模型”的底層藍(lán)圖。這不是一個(gè)關(guān)于預(yù)測(cè)準(zhǔn)確性的故事而是一個(gè)關(guān)于技術(shù)演進(jìn)路徑的深刻洞察AI要真正解決問(wèn)題不能只靠從海量數(shù)據(jù)中“猜”答案而需要引入類(lèi)似人類(lèi)“思考過(guò)程”的、可驗(yàn)證的推理鏈條。這份被忽視的PPT其價(jià)值不在于它預(yù)言了某個(gè)具體產(chǎn)品而在于它清晰地指出了當(dāng)時(shí)乃至現(xiàn)在很多模型的局限性并勾勒了一條不同的技術(shù)路線。今天當(dāng)我們看到o1模型在處理數(shù)學(xué)、編程、邏輯問(wèn)題時(shí)會(huì)主動(dòng)展示其“思考步驟”Chain of Thought或者像o3這樣更強(qiáng)調(diào)復(fù)雜、多步推理能力的模型時(shí)再回看那份PPT會(huì)發(fā)現(xiàn)它幾乎點(diǎn)明了幾個(gè)關(guān)鍵轉(zhuǎn)變從“黑箱輸出”到“白箱過(guò)程”傳統(tǒng)模型給你一個(gè)答案你不知道它怎么來(lái)的。而新的思路強(qiáng)調(diào)模型應(yīng)該輸出推導(dǎo)過(guò)程讓這個(gè)過(guò)程本身成為可檢查、可調(diào)試的對(duì)象。從“模式匹配”到“過(guò)程模擬”模型不應(yīng)僅僅在數(shù)據(jù)中尋找最終答案的統(tǒng)計(jì)模式而應(yīng)學(xué)會(huì)模擬解決問(wèn)題所需的步驟序列比如先分解問(wèn)題、再調(diào)用工具、最后整合結(jié)果。從“一次性生成”到“迭代優(yōu)化”答案不是一步到位的模型應(yīng)該有能力像人一樣“再想想”對(duì)初步結(jié)果進(jìn)行驗(yàn)證、反思和修正。對(duì)于開(kāi)發(fā)者、研究者甚至是關(guān)注AI產(chǎn)品邏輯的產(chǎn)品經(jīng)理來(lái)說(shuō)理解這個(gè)從“無(wú)稽之談”到核心思路的轉(zhuǎn)變比單純使用o1的API更有價(jià)值。它能幫你判斷一個(gè)AI工具是“真智能”還是“高級(jí)鸚鵡學(xué)舌”也能在你自己設(shè)計(jì)AI應(yīng)用時(shí)知道該往哪個(gè)方向優(yōu)化。接下來(lái)我們就拆解這份PPT思路與當(dāng)前o1/o3類(lèi)模型的對(duì)應(yīng)關(guān)系并看看在實(shí)際應(yīng)用中我們?cè)撊绾卫眠@種“推理優(yōu)先”的思維。2. 核心思路對(duì)照PPT的“預(yù)言”與o1/o3的“實(shí)現(xiàn)”那份舊PPT之所以在當(dāng)時(shí)顯得“離經(jīng)叛道”是因?yàn)樗魬?zhàn)了當(dāng)時(shí)以大數(shù)據(jù)、大算力驅(qū)動(dòng)模型“大力出奇跡”的主流范式。我們可以從幾個(gè)具體維度將PPT中的設(shè)想與當(dāng)前o1、o3等模型展現(xiàn)的特性進(jìn)行對(duì)照這能幫助我們抓住技術(shù)演進(jìn)的主線。2.1 設(shè)想一模型應(yīng)有“內(nèi)部獨(dú)白”或“草稿紙”P(pán)PT思路AI在給出最終答案前應(yīng)該在內(nèi)部或外部有一個(gè)類(lèi)似于人類(lèi)“打草稿”的過(guò)程。這個(gè)過(guò)程不是直接生成最終答案而是規(guī)劃步驟、嘗試推導(dǎo)、排除錯(cuò)誤選項(xiàng)。當(dāng)時(shí)的主流觀點(diǎn)認(rèn)為模型的“思考”是隱式的、分布式表征的強(qiáng)行要求一個(gè)可讀的中間過(guò)程是多此一舉甚至被批評(píng)為“擬人化”的謬誤。o1/o3的體現(xiàn)這正是o1模型最顯著的特征——思維鏈Chain of Thought, CoT。當(dāng)你向o1提出一個(gè)復(fù)雜的數(shù)學(xué)或邏輯問(wèn)題時(shí)它返回的不僅僅是答案而是一步一步的推理文本。例如問(wèn)題一個(gè)水池單開(kāi)進(jìn)水管6小時(shí)注滿單開(kāi)排水管8小時(shí)放空。如果同時(shí)打開(kāi)進(jìn)水管和排水管多久能注滿 模型輸出簡(jiǎn)化 1. 進(jìn)水管效率1/6 池/小時(shí)。 2. 排水管效率-1/8 池/小時(shí)。 3. 同時(shí)開(kāi)的凈效率(1/6) - (1/8) (4/24) - (3/24) 1/24 池/小時(shí)。 4. 注滿一池所需時(shí)間1 ÷ (1/24) 24 小時(shí)。 答案24小時(shí)。這個(gè)輸出過(guò)程就是PPT所設(shè)想的“草稿紙”。o3則在此基礎(chǔ)上被設(shè)計(jì)用于處理更冗長(zhǎng)、更復(fù)雜的多步推理問(wèn)題強(qiáng)調(diào)在超長(zhǎng)上下文中維持推理的一致性。實(shí)操意義對(duì)我們使用者而言這個(gè)特性改變了調(diào)試和信任的方式。以前模型答錯(cuò)了你只能猜測(cè)是數(shù)據(jù)偏置、提示詞不好還是模型容量不夠。現(xiàn)在你可以直接檢查它的推理步驟。如果第三步的計(jì)算錯(cuò)了你就能精準(zhǔn)定位問(wèn)題而不是面對(duì)一個(gè)錯(cuò)誤的最終答案束手無(wú)策。這極大地提升了AI在嚴(yán)肅任務(wù)如代碼審查、財(cái)務(wù)分析、學(xué)術(shù)推導(dǎo)中的可用性。2.2 設(shè)想二推理應(yīng)與“工具使用”無(wú)縫結(jié)合PPT思路真正的智能體不應(yīng)局限于文本生成當(dāng)遇到無(wú)法僅憑參數(shù)知識(shí)解決的問(wèn)題時(shí)如精確計(jì)算、實(shí)時(shí)信息查詢、專業(yè)工具操作應(yīng)能自主調(diào)用外部工具計(jì)算器、搜索引擎、API并將工具返回的結(jié)果整合進(jìn)推理流。o1/o3的體現(xiàn)雖然o1/o3本身是閉源模型其內(nèi)部機(jī)制未完全公開(kāi)但OpenAI整個(gè)平臺(tái)和API生態(tài)正在朝這個(gè)方向演進(jìn)。CodexGPT-3的后代專注于代碼可以看作是在編程這個(gè)特定領(lǐng)域的“工具使用”專家。更重要的是通過(guò)OpenAI API的Function Calling或Assistant API的Tools功能開(kāi)發(fā)者可以輕松地為模型配備調(diào)用外部工具的能力。模型會(huì)先“思考”是否需要調(diào)用工具、調(diào)用哪個(gè)工具、傳入什么參數(shù)然后執(zhí)行調(diào)用最后基于返回結(jié)果繼續(xù)推理。實(shí)操意義這意味著你在構(gòu)建AI應(yīng)用時(shí)設(shè)計(jì)重點(diǎn)從“如何讓模型生成更好的文本”轉(zhuǎn)向“如何為模型設(shè)計(jì)一套好用的工具以及調(diào)用邏輯”。例如一個(gè)客服AI當(dāng)用戶問(wèn)“我的訂單#123456到哪里了”時(shí)模型的“思考過(guò)程”應(yīng)該是1. 識(shí)別這是一個(gè)查詢請(qǐng)求。2. 提取關(guān)鍵實(shí)體“訂單#123456”。3. 決定調(diào)用“訂單查詢API”并傳入訂單號(hào)。4. 將API返回的物流信息組織成自然語(yǔ)言回復(fù)給用戶。這份PPT在五年前就強(qiáng)調(diào)了這種“規(guī)劃-調(diào)用-整合”的流水線而現(xiàn)在這已成為構(gòu)建實(shí)用AI智能體的標(biāo)準(zhǔn)范式。2.3 設(shè)想三學(xué)習(xí)目標(biāo)不僅是答案正確更是過(guò)程可靠PPT思路訓(xùn)練模型時(shí)不應(yīng)該只使用問(wèn)題答案這樣的配對(duì)數(shù)據(jù)。更有效的是使用問(wèn)題推理過(guò)程答案這樣的數(shù)據(jù)。模型的學(xué)習(xí)目標(biāo)是模仿這個(gè)推理過(guò)程而不僅僅是匹配最終答案。這被稱為“過(guò)程監(jiān)督”而非“結(jié)果監(jiān)督”。o1/o3的體現(xiàn)這正是OpenAI訓(xùn)練o1這類(lèi)模型可能采用的核心技術(shù)之一。有研究顯示通過(guò)人工標(biāo)注或模型自生成的優(yōu)質(zhì)推理步驟過(guò)程并對(duì)這些步驟進(jìn)行獎(jiǎng)勵(lì)或優(yōu)化可以顯著提升模型在復(fù)雜問(wèn)題上的表現(xiàn)。o1在數(shù)學(xué)和代碼上的優(yōu)異表現(xiàn)很可能得益于大量高質(zhì)量“過(guò)程數(shù)據(jù)”的訓(xùn)練。相比之下僅用答案訓(xùn)練出來(lái)的模型更容易產(chǎn)生“幻覺(jué)”——它可能蒙對(duì)答案但過(guò)程完全錯(cuò)誤這種錯(cuò)誤在復(fù)雜任務(wù)中是致命的。實(shí)操意義對(duì)于從事AI訓(xùn)練或微調(diào)的研究者和工程師這指明了數(shù)據(jù)標(biāo)注的新方向。如果你希望自己的領(lǐng)域模型有可靠的推理能力那么收集或生成“帶步驟的解答”比單純收集“問(wèn)答對(duì)”更有價(jià)值。即使是普通用戶在選擇AI服務(wù)時(shí)也可以將“是否提供推理過(guò)程”作為一個(gè)重要的可靠性評(píng)估指標(biāo)。一個(gè)能展示清晰過(guò)程的模型其答案的可信度通常更高。3. 如何將“推理核心”思路應(yīng)用于你的項(xiàng)目理解了這份PPT與o1/o3的思路傳承我們不能只停留在“看熱鬧”的層面。更重要的是如何將這種“重視推理過(guò)程”的思維應(yīng)用到我們自己的開(kāi)發(fā)、研究或產(chǎn)品設(shè)計(jì)中。即使你不直接使用o1的API這些原則也極具指導(dǎo)價(jià)值。3.1 設(shè)計(jì)提示詞Prompt引導(dǎo)模型“展示工作”對(duì)于使用GPT-4、Claude-3等具備一定推理能力的通用模型你可以通過(guò)提示詞工程強(qiáng)制或鼓勵(lì)它們進(jìn)行分步思考?;A(chǔ)方法使用思維鏈CoT提示不要直接問(wèn)“解方程 2x 5 13?!?而是這樣問(wèn)“請(qǐng)一步步解這個(gè)方程2x 5 13。首先解釋你要做什么然后展示每一步計(jì)算?!边M(jìn)階方法指定推理格式JSON結(jié)構(gòu)對(duì)于需要集成到自動(dòng)化流程中的任務(wù)你可以要求模型以結(jié)構(gòu)化格式輸出推理和答案。你是一個(gè)數(shù)學(xué)解題助手。請(qǐng)以以下JSON格式回應(yīng) { “question”: “用戶輸入的問(wèn)題”, “reasoning_steps”: [ {“step”: 1, “action”: “描述第一步操作”, “result”: “第一步的結(jié)果”}, {“step”: 2, “action”: “描述第二步操作”, “result”: “第二步的結(jié)果”} ], “final_answer”: “最終答案” } 問(wèn)題一個(gè)房間長(zhǎng)5米寬4米鋪邊長(zhǎng)0.5米的地磚需要多少塊這樣你的后端代碼可以輕松解析reasoning_steps來(lái)檢查邏輯或記錄用于分析。避坑點(diǎn)不是所有問(wèn)題都適合強(qiáng)制分步。對(duì)于創(chuàng)意寫(xiě)作、詩(shī)歌生成分步提示可能會(huì)限制發(fā)揮。但對(duì)于邏輯、計(jì)算、分類(lèi)、規(guī)劃類(lèi)任務(wù)這能大幅提升輸出的準(zhǔn)確性和可解釋性。3.2 構(gòu)建智能體Agent規(guī)劃、工具、驗(yàn)證循環(huán)當(dāng)你需要構(gòu)建一個(gè)能執(zhí)行復(fù)雜任務(wù)的AI智能體時(shí)應(yīng)該明確借鑒“推理核心”的思路設(shè)計(jì)一個(gè)清晰的執(zhí)行循環(huán)。一個(gè)典型的智能體工作流應(yīng)包含以下階段任務(wù)解析與規(guī)劃智能體首先理解用戶請(qǐng)求并將其分解為一系列子任務(wù)或步驟。例如“幫我分析上個(gè)月的銷(xiāo)售數(shù)據(jù)并寫(xiě)一份報(bào)告”可以分解為a) 獲取銷(xiāo)售數(shù)據(jù)b) 計(jì)算關(guān)鍵指標(biāo)總額、環(huán)比、Top產(chǎn)品c) 生成圖表d) 撰寫(xiě)分析文本。工具選擇與調(diào)用為每個(gè)子任務(wù)分配合適的工具或能力。獲取數(shù)據(jù)可能需要調(diào)用數(shù)據(jù)庫(kù)API計(jì)算指標(biāo)可能需要調(diào)用Python pandas代碼解釋器生成圖表需要調(diào)用繪圖庫(kù)撰寫(xiě)文本則由大模型本身完成。執(zhí)行與結(jié)果驗(yàn)證按順序執(zhí)行子任務(wù)。每得到一個(gè)中間結(jié)果智能體應(yīng)進(jìn)行基本驗(yàn)證如數(shù)據(jù)是否為空、計(jì)算是否出錯(cuò)。如果失敗應(yīng)能重試或調(diào)整計(jì)劃。綜合與輸出將所有子任務(wù)的結(jié)果整合形成最終輸出如一份包含圖表和文字的報(bào)告。實(shí)操建議使用LangChain、LlamaIndex、Semantic Kernel這類(lèi)框架可以相對(duì)容易地搭建這樣的智能體。關(guān)鍵不在于框架本身而在于你能否清晰地定義出上述每個(gè)環(huán)節(jié)。我建議在初期先用流程圖或偽代碼把整個(gè)智能體的“思考”和“行動(dòng)”路徑畫(huà)出來(lái)然后再去寫(xiě)代碼實(shí)現(xiàn)。3.3 評(píng)估模型輸出從看答案到審過(guò)程當(dāng)評(píng)估一個(gè)AI模型或你構(gòu)建的AI應(yīng)用時(shí)評(píng)估標(biāo)準(zhǔn)需要升級(jí)。傳統(tǒng)評(píng)估結(jié)果導(dǎo)向答案是否正確是/否代碼能否運(yùn)行通過(guò)/失敗摘要是否包含了關(guān)鍵信息主觀評(píng)分基于推理的評(píng)估過(guò)程結(jié)果導(dǎo)向過(guò)程合理性推理步驟是否符合邏輯是否有跳躍或矛盾工具調(diào)用恰當(dāng)性是否在需要時(shí)調(diào)用了正確的工具調(diào)用參數(shù)是否正確錯(cuò)誤可追溯性如果最終答案錯(cuò)誤能否從推理過(guò)程中明確找到第一個(gè)出錯(cuò)的步驟效率與冗余推理過(guò)程是否簡(jiǎn)潔高效有無(wú)不必要的循環(huán)或查詢例如評(píng)估一個(gè)代碼生成模型不僅要看生成的代碼是否能通過(guò)測(cè)試用例還要審查它的“思考過(guò)程”它是否先理解了需求是否考慮了邊界條件是否選擇了合適的算法這個(gè)過(guò)程的質(zhì)量直接決定了它在未見(jiàn)過(guò)案例上的泛化能力。4. 當(dāng)前局限與未來(lái)展望我們離“完美推理體”還有多遠(yuǎn)盡管o1、o3等模型標(biāo)志著向正確方向邁出了一大步但我們必須清醒地認(rèn)識(shí)到完全實(shí)現(xiàn)五年前那份PPT的愿景仍有很長(zhǎng)的路要走。理解這些局限能幫助我們?cè)趯?shí)際應(yīng)用中設(shè)定合理的期望并找到應(yīng)對(duì)策略。4.1 現(xiàn)有模型的典型局限過(guò)程可能“造假”或“粉飾”模型生成的推理鏈有時(shí)是為了“迎合”生成最終答案而事后編造的并非其真實(shí)的決策路徑。這種現(xiàn)象被稱為“事后合理化”。你可能得到一個(gè)正確的答案和一個(gè)看起來(lái)合理的錯(cuò)誤過(guò)程或者一個(gè)錯(cuò)誤答案和一個(gè)看似流暢的過(guò)程。應(yīng)對(duì)策略對(duì)于關(guān)鍵任務(wù)不要完全信任單一的過(guò)程輸出。可以采用“自我驗(yàn)證”提示例如讓模型用另一種方法驗(yàn)證自己的答案或者將復(fù)雜問(wèn)題分解后讓模型分別回答子問(wèn)題再綜合。對(duì)超長(zhǎng)、復(fù)雜推理的穩(wěn)定性不足o3雖然針對(duì)長(zhǎng)上下文優(yōu)化但當(dāng)推理步驟多達(dá)數(shù)十步、涉及多個(gè)領(lǐng)域知識(shí)來(lái)回切換時(shí)模型仍可能出現(xiàn)注意力漂移、忘記前提條件或陷入循環(huán)。應(yīng)對(duì)策略在工程實(shí)現(xiàn)上主動(dòng)幫模型做“狀態(tài)管理”。將超長(zhǎng)任務(wù)拆分成多個(gè)有明確輸入輸出的階段每個(gè)階段結(jié)束后人工或通過(guò)規(guī)則檢查中間結(jié)果再作為新階段的輸入。避免讓模型一次性處理過(guò)于復(fù)雜的指令鏈。工具使用的可靠性與安全性模型決定調(diào)用工具是一回事能否每次都正確使用工具是另一回事。參數(shù)格式錯(cuò)誤、處理工具返回的異常、防止無(wú)限循環(huán)或危險(xiǎn)操作都是需要開(kāi)發(fā)者精心設(shè)計(jì)的系統(tǒng)級(jí)問(wèn)題不能完全交給模型。應(yīng)對(duì)策略對(duì)工具調(diào)用進(jìn)行嚴(yán)格的沙盒化和權(quán)限控制。為每個(gè)工具設(shè)計(jì)清晰的輸入輸出規(guī)范并在調(diào)用前后加入?yún)?shù)校驗(yàn)和結(jié)果過(guò)濾。記錄完整的工具調(diào)用日志便于出錯(cuò)時(shí)回溯。成本與延遲進(jìn)行多步推理、尤其是調(diào)用外部工具會(huì)顯著增加API調(diào)用次數(shù)和總體響應(yīng)時(shí)間。o1模型的API調(diào)用成本也高于標(biāo)準(zhǔn)的聊天模型。應(yīng)對(duì)策略做好緩存。對(duì)于常見(jiàn)問(wèn)題或中間結(jié)果可以建立緩存機(jī)制。區(qū)分場(chǎng)景對(duì)實(shí)時(shí)性要求高但復(fù)雜度低的任務(wù)可能不需要啟用完整推理鏈對(duì)離線分析、報(bào)告生成等任務(wù)則可以接受更長(zhǎng)的處理時(shí)間。4.2 未來(lái)可能的發(fā)展方向這份PPT的思路為未來(lái)的AI發(fā)展提供了一個(gè)清晰的路線圖。我們可以預(yù)期以下幾個(gè)方向會(huì)成為重點(diǎn)推理過(guò)程的“形式化”與“驗(yàn)證”未來(lái)的模型可能不僅生成自然語(yǔ)言推理步驟還能生成某種形式化的、機(jī)器可驗(yàn)證的中間表示如邏輯表達(dá)式、計(jì)算圖。這將允許第三方程序自動(dòng)檢查推理過(guò)程的正確性極大提升可靠性?!八伎肌迸c“行動(dòng)”的更深度融合當(dāng)前的智能體范式里“規(guī)劃”思考和“執(zhí)行”行動(dòng)的界限還比較清晰。未來(lái)可能會(huì)出現(xiàn)更緊密的耦合模型在行動(dòng)中獲得反饋后能實(shí)時(shí)、動(dòng)態(tài)地調(diào)整后續(xù)的思考計(jì)劃更像人類(lèi)的“邊做邊想”。專業(yè)化推理模型涌現(xiàn)就像Codex之于代碼未來(lái)會(huì)出現(xiàn)專精于數(shù)學(xué)證明、法律分析、科學(xué)發(fā)現(xiàn)、商業(yè)決策等特定領(lǐng)域的“推理模型”。它們將在各自領(lǐng)域擁有更嚴(yán)謹(jǐn)、更可靠的推理過(guò)程和工具鏈。訓(xùn)練范式的根本變革“過(guò)程監(jiān)督”可能會(huì)成為訓(xùn)練高端AI模型的主流甚至標(biāo)配。如何高效、低成本地獲取大規(guī)模、高質(zhì)量的“過(guò)程數(shù)據(jù)”將成為核心研究課題。合成數(shù)據(jù)、模型自蒸餾、對(duì)抗性訓(xùn)練等方法可能會(huì)被廣泛應(yīng)用。5. 給開(kāi)發(fā)者和研究者的行動(dòng)清單回顧這份從“無(wú)稽之談”到行業(yè)共識(shí)的歷程我們能得到的最寶貴經(jīng)驗(yàn)是在技術(shù)浪潮中那些挑戰(zhàn)根本假設(shè)、看似“不切實(shí)際”的思路往往蘊(yùn)含著下一波突破的種子。對(duì)于身處其中的我們以下是一些可以立即付諸實(shí)踐的行動(dòng)建議如果你是一名AI應(yīng)用開(kāi)發(fā)者重新審視你的提示詞在涉及邏輯、計(jì)算、分析的場(chǎng)景中立即開(kāi)始使用思維鏈CoT提示技術(shù)。觀察輸出質(zhì)量的變化。以“智能體”思維設(shè)計(jì)產(chǎn)品不要只做一個(gè)問(wèn)答接口。思考你的產(chǎn)品任務(wù)能否被分解為“感知-規(guī)劃-行動(dòng)-驗(yàn)證”的循環(huán)。為用戶提供的不只是答案而是解決問(wèn)題的“過(guò)程”和“依據(jù)”。重視可解釋性在你的應(yīng)用日志中不僅記錄用戶的輸入和模型的最終輸出盡可能記錄模型的關(guān)鍵推理步驟或工具調(diào)用記錄。這在調(diào)試和贏得用戶信任時(shí)至關(guān)重要。從成本角度規(guī)劃評(píng)估引入深度推理模型如o1或復(fù)雜智能體流程帶來(lái)的額外成本和延遲并在產(chǎn)品設(shè)計(jì)初期就將其納入考量。如果你是一名AI研究者或算法工程師關(guān)注“過(guò)程優(yōu)化”而非僅僅“結(jié)果優(yōu)化”在訓(xùn)練或微調(diào)模型時(shí)嘗試引入過(guò)程獎(jiǎng)勵(lì)。即使沒(méi)有人工標(biāo)注的過(guò)程數(shù)據(jù)也可以探索通過(guò)規(guī)則、驗(yàn)證器或模型自評(píng)來(lái)生成過(guò)程監(jiān)督信號(hào)。深入研究工具學(xué)習(xí)Tool Learning如何讓模型更魯棒、更安全地學(xué)習(xí)和使用工具是一個(gè)極具潛力的方向。關(guān)注相關(guān)論文和開(kāi)源項(xiàng)目。思考推理的形式化表示在你的領(lǐng)域能否設(shè)計(jì)一種比自然語(yǔ)言更精確、更緊湊的中間表示來(lái)刻畫(huà)推理過(guò)程這可能是實(shí)現(xiàn)可靠推理的關(guān)鍵。如果你是一名技術(shù)決策者或產(chǎn)品經(jīng)理用“推理能力”評(píng)估第三方AI服務(wù)在選擇AI供應(yīng)商或模型時(shí)將“是否支持思維鏈”、“工具調(diào)用能力如何”、“過(guò)程是否可追溯”作為重要的評(píng)估維度。投資于高質(zhì)量的過(guò)程數(shù)據(jù)如果你的業(yè)務(wù)高度依賴AI的決策邏輯考慮啟動(dòng)數(shù)據(jù)標(biāo)注項(xiàng)目專門(mén)收集“問(wèn)題-推理過(guò)程-答案”三位一體的高質(zhì)量數(shù)據(jù)這將是你未來(lái)模型能力的護(hù)城河。管理用戶預(yù)期教育你的用戶和客戶讓他們理解“具有推理過(guò)程的AI”和“傳統(tǒng)聊天AI”的區(qū)別以及前者在復(fù)雜任務(wù)上的優(yōu)勢(shì)和價(jià)值所在。五年前那份PPT的價(jià)值在今天看來(lái)不在于它多么精確地預(yù)言了OpenAI的產(chǎn)品代號(hào)而在于它勇敢地指出了當(dāng)時(shí)主流技術(shù)路徑的一個(gè)盲點(diǎn)并描繪了一條更具潛力的替代路徑。今天o1、o3以及整個(gè)行業(yè)對(duì)推理的重視證明了這條路徑的可行性。作為從業(yè)者我們的任務(wù)不是等待下一個(gè)“預(yù)言”實(shí)現(xiàn)而是深刻理解這些核心思路并將其轉(zhuǎn)化為我們手中更可靠、更智能、更能創(chuàng)造真實(shí)價(jià)值的產(chǎn)品和解決方案。這條路才剛剛開(kāi)始。