深色模式
EP3 記憶之桶:為什麼 AI 會「失憶」?
AI 明明剛才還記得你的名字,聊幾十回合之後突然忘了。這不是 bug、不是 AI 在鬧脾氣——他就是單純裝不下了。搞懂這個機制,你就會知道角色卡該怎麼寫、世界書該怎麼用,以及為什麼免費平台失憶得特別快。
影片即將上線
本段影片將在 6/20 直播結束後上架。以下是文字重點摘要,可以配合影片一起看。
「上下文」是什麼?
「上下文」這個詞在LLM運用上,實際不是你在前台畫面上看到的那串你跟AI的聊天紀錄。
上下文(context)=每次大廚開始做菜之前,服務生整理好遞給他的那一整包資料。 換句話說,LLM 所謂的上下文,是每次送進廚房的全部東西,而不只是你眼睛看得到的對話。
這酒館的上下文資料包裡有:
- 系統提詞(釘在廚房牆上的規矩)
- 角色卡(角色的設定)
- 世界書(可觸發的背景設定)
- 聊天紀錄(你們之前說過的話)
這些東西全部被裝進一個「記憶之桶」裡。每次你發送訊息,大廚都會把整桶內容從頭到尾重新看一遍,然後才動手做菜。
關鍵在這裡:大廚每次回覆,都是把這整包資料重新看一遍,然後猜「下一個字是什麼」。他不是「記得」你們說過的話,而是每次都「重讀」了一遍紀錄。
鐵律:如果某段對話不在桶子裡,對大廚來說他就從未存在過。他沒有長期記憶,只有「當下手邊的這包資料」。

記憶之桶:分層結構
這一整包資料,想像成一個木桶,桶內由上到下是有層次的。以 SillyTavern 的架構為例,大致是這樣排的: 
注意最上層是系統提詞,不一定只會釘在最上面也可能被設計穿插在中間,只是他會被固定住不會流出去;最底層則是你們的聊天紀錄,而你剛剛送出的那則訊息就躺在桶子最底部。
越靠近桶底(越新的內容),對大廚當下直覺的影響越大。 這也是為什麼你的最新一句話對 AI 的回覆影響最直接,因為他在桶子最底部,最新鮮、影響力最強。
U 形注意力:被夾在中間的設定最容易被忽略
知道桶子的分層之後,還有一個更關鍵、卻很少人講的真相:大廚對桶內資訊的注意力,並不是均勻分佈的。
根據研究(學界稱為 "Lost in the Middle" 現象),模型的注意力呈現一個 U 形分佈——最上層和最底層的影響力最大,夾在中間的內容最容易被忽略。
系統提詞
角色卡中段
中段設定
較舊對話
最新訊息
這條 U 形曲線一次解釋了三件事:
1為什麼系統提詞重要:他在桶子最頂端,正好落在 U 形的左端高點,模型對他特別敏感,所以他最能定調整場對話的規矩與口吻。
2為什麼最新訊息重要:你剛送出的那則訊息在桶子最底部,落在 U 形的右端高點,影響力最大。你寫得越用心,大廚接得越好。
3為什麼角色卡中間的細節有時被「跳過」:那些藏在角色卡中段、被前後內容夾住的設定,正好落在 U 形谷底,是最容易被模型滑過去、沒注意到的地方。
所以如果有一條設定對你很重要,把他埋在一大段描述的正中間,是最不保險的做法。重要的東西,要往頭尾兩端放,或寫得夠醒目,才不會掉進中間這個注意力的谷底。
失憶的真相:桶子會溢出
每個模型的桶子容量都是有限的(常見的有 40K、80K、100K、甚至 200K token),而且這個桶子不是全部留給你輸入的——別忘了,AI 的回覆也要在桶子裡寫出來。
於是有一條很容易被忽略的公式:
上下文長度 − 最大回應長度 = AI 能讀取的輸入空間 桶子要先預留位置給 AI 寫回覆,剩下的才是他能讀進去的料。
這代表:如果你把「最大回應長度」開得很高,留給輸入的空間就被壓縮,AI 能讀到的對話和設定變少,於是更快失憶。很多人以為「回應長度開越大越好」,其實是反過來壓縮了大廚的記憶空間。
當桶子裝滿了,新的對話進來,最舊的聊天紀錄就會從桶子裡被擠出去。失憶的對象永遠是最舊的那一段對話,而不是你精心寫好的角色設定。
舉個例子:你在對話第三回合說的事,聊了五十回合之後,那個回合的紀錄早就已經不在桶子裡了。大廚沒有辦法「記得」一個他根本看不到的東西。
鐵律:失憶不是 AI 在鬧脾氣,是桶子的物理空間不夠了。被擠掉的永遠是最舊的對話。

永久區 vs. 臨時區
桶子裡的內容分兩種區域,命運完全不同:
永久區(不管對話多長都不會被擠出去):
- 系統提詞
- 世界書條目
- 角色描述
- 使用者描述
- 性格總結
- 場景設定
臨時區(桶子滿了就開始被擠出):
- 對話示例
- 舊的聊天紀錄(最舊的先被擠)
這個設計給你一個很清楚的指引:你希望 AI 永遠記得的事,要放進永久區,也就是寫進角色卡(character card)或世界書(worldbook),不要只在聊天裡隨口說。隨口說的話躺在臨時區,遲早會被擠出桶外。
怎麼讓 AI 擁有好的記憶力?
既然失憶的本質是桶子溢出,對策就很清楚了。

1想讓 AI 永遠記得的,寫進永久區:寫進角色卡或做成世界書條目,讓他待在永久區,不會被擠掉。
2但永久區也要精簡:角色卡和世界書一樣佔桶子空間。寫得太肥,等於排擠了聊天紀錄的空間,反而讓 AI 更快忘記最近發生的事。
3不常用的背景設定丟世界書:設定觸發關鍵字,平時不佔位,需要時才上桌。
角色卡要這樣寫
現在你懂了記憶之桶,你就知道角色卡的寫法準則:
該放進角色卡的:
- 角色的核心個性(每次都要維持的特質)
- 角色的外貌、名字、背景
- 你和角色的關係設定
- 你希望 AI 每次都遵守的規則
不要只在聊天裡說的:
- 「記住,你的個性是……」——聊天紀錄會被擠出去,這句話之後就消失了
- 「你剛才說過……」——如果那個回合已經被擠出桶外,AI 確實不記得了
關於世界書(worldbook)
世界書是個很聰明的設計。他的好處是「觸發才上桌,平時不佔位」:條目平時不會佔用桶子空間,只有對話中出現指定的關鍵字,相關條目才會自動「上桌」加進上下文。
把他想成「隱藏食材匣」,平常鎖在倉庫,需要的時候才開鎖拿進廚房。你可以把很多背景設定放進世界書,不會一直佔用桶子空間,卻又能在需要的時候自動起作用。
詳細的世界書操作方法,在使用教學→世界書入門。
常見問題
Q:我可以讓 AI 有永久記憶嗎?
在基礎設定裡沒有。有些擴充功能(如聊天摘要擴充)可以定期把重要訊息整理進角色卡或世界書,變相實現「更長的記憶」,但這是進階玩法,初學者先搞懂桶子的基本邏輯就夠了。
Q:桶子多大才夠用?
實際玩 RP,建議至少開到 40K(4 萬)Token 起跳——角色卡、世界書、對話歷史很快就會吃掉空間,開太小很快就開始失憶。有條件的話拉到 80K、100K 以上會更穩。好消息是現代模型(像 Gemini、Claude)的上下文上限動輒上百 K,開大不是技術問題,主要是費用考量:桶子越大,每次送進廚房的 Token 越多,API 費用也跟著高,自己抓一個品質和花費的平衡點就好。免費平台常常只給你幾 K,這也是免費平台 AI 失憶特別快的原因之一。
Q:最大回應長度開越大越好嗎?
不是。回想前面的公式:上下文長度 − 最大回應長度 = 輸入空間。回應長度開太高,留給輸入的位置就被吃掉,AI 能讀到的對話和設定變少,反而更快失憶。開到夠用就好,不用一味調高。
Q:對話示例放太多有什麼影響?
對話示例(角色說話方式的範例)放越多,佔用的桶子空間越大,會壓縮留給聊天紀錄的空間,讓失憶速度加快。一般建議對話示例控制在合理範圍,不要塞太多。
📌 本集重點
- 上下文 = 送進廚房的全部:不是畫面上的對話前後文,而是每次回覆前遞給 AI 的整包資料——系統提詞、角色卡、世界書、聊天紀錄。
- 注意力呈 U 形分佈:頂端的系統提詞與底端的最新訊息影響力最大,夾在中間的設定最容易被忽略(Lost in the Middle)。
- 失憶是物理現象:桶子溢出時,最舊的對話被擠出去,不是 AI 鬧脾氣。回應長度開太大還會壓縮輸入空間,失憶更快。
- 要 AI 永遠記得,寫進永久區:放進角色卡或世界書(永久區);不常用的背景丟世界書設觸發詞,觸發才上桌。
下一步
EP4 大廚的盲區:除了失憶,AI 還有哪些我們理所當然、但他完全不懂的事?
