多模態模型中的不對稱特異性
10/6(二)Imperial Ballroom #1多模態 LM
視覺語言模型中的來源模態監控
ORAL10/6(二)Imperial Ballroom #2多模態 LM
當「看見」凌駕「知道」:視覺語言模型中個人化安全的視覺主導性與延遲判斷法
10/6(二)Imperial Ballroom #3安全
V-DEAL:將影片安全失準診斷為「理解—拒絕」耦合失敗
10/6(二)Imperial Ballroom #4安全
小心你所自動完成的:後門程式碼補全的鑑識溯源
10/6(二)Imperial Ballroom #5安全
現行大多數「模型生物」都會洩漏資訊:困惑度差異法經常能揭露微調目標
10/6(二)Imperial Ballroom #6安全
對齊中的盲點:量化大型語言模型的生物安全風險
10/6(二)Imperial Ballroom #7安全
Self-Correction Bench:揭露並解決大型語言模型中的自我修正盲點
10/6(二)Imperial Ballroom #8推論演算法
壓力下的脆弱性:評估 LLM 在受限互動式程式設計中的迭代穩定性
10/6(二)Imperial Ballroom #9評測
LPDS:透過保持邏輯不變的難度縮放評估 LLM 穩健性
10/6(二)Imperial Ballroom #10評測
LLM 對於作業研究是否夠穩健?透過 AttackOR 進行的對抗攻擊與防禦研究
10/6(二)Imperial Ballroom #11安全
ConformalGuard:語言模型分類器的假陽性可控行動閘控
10/6(二)Imperial Ballroom #12評測
BAS:以決策理論方法評估大型語言模型的信心程度
10/6(二)Imperial Ballroom #13評測
Pinocchio:黑箱語言模型的快速不確定性估計
10/6(二)Imperial Ballroom #14評測
FERA:大型語言模型的不確定性感知聯邦推理
10/6(二)Imperial Ballroom #15學習演算法
KoSimpleQA:韓語事實性基準測試與推理型 LLM 分析
10/6(二)Imperial Ballroom #16普惠 LM
透過社會元學習學習如何從語言回饋中學習
10/6(二)Imperial Ballroom #17LM 與互動
情境內探索與利用之取捨受語意先驗偏誤影響
10/6(二)Imperial Ballroom #18心智、大腦、哲學、法律
ContextBudget:面向長視野搜尋代理的預算感知情境管理
10/6(二)Imperial Ballroom #19工具與程式
潛在情境編譯:將長情境萃取為緊湊可攜式記憶
10/6(二)Imperial Ballroom #20高效運算
自我剪枝 Transformer:以通用注意力機制實現極致 KV 快取壓縮
10/6(二)Imperial Ballroom #21高效運算
HISA:用於細粒度稀疏注意力的高效階層式索引
10/6(二)Imperial Ballroom #22高效運算
凝視注意力:面向高效多模態 LLM 的查詢自適應視覺路由
10/6(二)Imperial Ballroom #23高效運算
從估計的聆聽者凝視中學習指稱表達
10/6(二)Imperial Ballroom #24多模態 LM
以顯式的位置到座標映射改善 GUI 定位
10/6(二)Imperial Ballroom #25工具與程式
v1:學習指向視覺 token 以實現多模態數學紮根推理
10/6(二)Imperial Ballroom #26多模態 LM
看見未見之物:Transformer 在符號推理中的泛化能力
10/6(二)Imperial Ballroom #27語言模型科學
以思考換取回想:推理如何解鎖 LLM 中的參數化知識
10/6(二)Imperial Ballroom #28LM 與世界
多語言 LLM 中對非參數化記憶的推理:關係知識的認知基礎分析
10/6(二)Imperial Ballroom #29普惠 LM
揭露支持大型語言模型中類人概念表徵的計算成分
10/6(二)Imperial Ballroom #30心智、大腦、哲學、法律
大型語言模型在創意思考期間與人腦活動對齊
10/6(二)Imperial Ballroom #31心智、大腦、哲學、法律
CreativityBench:透過基於可供性的工具再利用評估創意推理
10/6(二)Imperial Ballroom #32評測
工具的幻象:重新思考網頁代理中的工具使用
10/6(二)Imperial Ballroom #33工具與程式
CollabSkill:評估真實世界任務中的人機協作
ORAL10/6(二)Imperial Ballroom #34LM 與互動
SkillLearnBench:為真實世界任務中的代理技能生成,對持續學習方法進行基準測試
10/6(二)Imperial Ballroom #35學習演算法
刻劃模型原生技能
10/6(二)Imperial Ballroom #36語言模型科學
語言模型中的能力溯源:一項社會推理的案例研究
10/6(二)Imperial Ballroom #37資料
原型語言模型
10/6(二)Imperial Ballroom #38語言模型科學
分布偏移下用於忠實生成的 token 層級離策略學習
10/6(二)Imperial Ballroom #39訓練
解密 OPD:大型語言模型的長度膨脹與穩定化策略
10/6(二)Imperial Ballroom #40訓練
功能先於形式:具備副本專家機制的專家混合模型中的分布正交化
10/6(二)Imperial Ballroom #41學習演算法
MoRE:重複使用專家的混合模型
10/6(二)Imperial Ballroom #42學習演算法
深度漸增模型能否克服深度詛咒?一項深入分析
10/6(二)Imperial Ballroom #43學習演算法
Parcae:穩定循環語言模型的縮放定律
10/6(二)Imperial Ballroom #44語言模型科學
大型語言模型訓練動態背後的頻譜傳輸機制
10/6(二)Imperial Ballroom #45語言模型科學
MegaTrain:在單一 GPU 上以全精度訓練超過 1000 億參數的大型語言模型
10/6(二)Imperial Ballroom #46大型 LM 工程
KronQ:透過 Kronecker 分解 Hessian 進行的 LLM 量化
10/6(二)Imperial Ballroom #47高效運算
用於二次規劃與決策制定的共變異數感知 Transformer
10/6(二)Imperial Ballroom #48多元領域與新應用
Squeeze Evolve:用於無驗證器演化的統一多模型編排框架
10/6(二)Imperial Ballroom #49大型 LM 工程
DreamProver:透過清醒—睡眠定理證明代理演化可遷移的引理庫
10/6(二)Imperial Ballroom #50推論演算法
Goedel-Code-Prover:面向開放最先進程式碼驗證的階層式證明搜尋
10/6(二)Imperial Ballroom #51推論演算法
Intern-S1-MO:面向奧林匹亞級數學解題的長視野推理代理
10/6(二)Imperial Ballroom #52訓練
面向工具增強型大型語言模型的程序感知強化學習
10/6(二)Imperial Ballroom #53訓練
CuSearch:透過搜尋深度實現代理式 RAG 的課程式推演取樣
10/6(二)Imperial Ballroom #54訓練
Struct-Searcher:代理式結構化思考推進多模態深度資訊探尋
10/6(二)Imperial Ballroom #55工具與程式
澄清或回答:面向情境規格不明代理式視覺問答的強化學習
10/6(二)Imperial Ballroom #56多模態 LM
針對模糊請求的意圖推理
ORAL10/6(二)Imperial Ballroom #57LM 與互動
先知後答:解讀語言模型以實現可靠的 RAG
10/6(二)Imperial Ballroom #58LM 與世界
修訂還是重新求解?拆解多 LLM 流程中第二輪的收益來源
10/6(二)Imperial Ballroom #59推論演算法
RationalRewards:推理獎勵同時擴展視覺生成的訓練與測試階段
10/6(二)Imperial Ballroom #60多模態 LM
Personalized RewardBench:以符合人類的個人化評估獎勵模型
10/6(二)Imperial Ballroom #61評測
LLM 能辨識你的潛在偏好嗎?個人化互動中潛在資訊發現的基準測試
10/6(二)Imperial Ballroom #62LM 與互動
PreScam:從早期對話預測詐騙進程的基準測試
10/6(二)Imperial Ballroom #63安全
留意代理式任務使用者模擬中的模擬到真實落差
10/6(二)Imperial Ballroom #64評測
InterviewSim:一套以訪談為紮根的人格模擬可擴展框架
10/6(二)Imperial Ballroom #65LM 與世界
從內部辨識內省
10/6(二)Imperial Ballroom #66心智、大腦、哲學、法律
規則對比後果:LLM 中道德推理的可分離內部表徵
10/6(二)Imperial Ballroom #67心智、大腦、哲學、法律
互動協定形塑多代理辯論中的道德判斷
10/6(二)Imperial Ballroom #68LM 與互動
失準的傳染:失準少數能否在多代理 LLM 審議中撼動對齊的多數?
10/6(二)Imperial Ballroom #69安全
深度研究代理帶來更深層的危害
10/6(二)Imperial Ballroom #70安全
不受歡迎的人設:單一方法的安全評估對賦予人設的 LLM 而言並不完整
10/6(二)Imperial Ballroom #71安全
隱藏的操偶師:預測操縱性 LLM 對話中的人類信念變化
10/6(二)Imperial Ballroom #72LM 與互動
將自己訓練成一個 LLM:透過角色扮演式 LLM 訓練探索 AI 素養對說服力的影響
10/6(二)Imperial Ballroom #73LM 與互動
自主性如何重塑個人化對 LLM 代理隱私疑慮與信任的影響
10/6(二)Franciscan A #74LM 與互動
將計就計:透過心智理論學習用於信念操控的雙面間諜防禦者
10/6(二)Franciscan A #75安全
源自敘事小說的情境化規範擬像
10/6(二)Franciscan A #76安全
LLM 內部是否知道什麼是隱私?探測並操控大型語言模型表徵中的情境隱私規範
10/6(二)Franciscan A #77安全
潛意識操控:隱藏訊號的編碼與偵測
10/6(二)Franciscan A #78安全
流形操控揭示神經網路表徵與行為的共享幾何結構
10/6(二)Franciscan A #79語言模型科學
透過生成式因果中介進行激活操控
10/6(二)Franciscan A #80語言模型科學
操控 LLM 以生成具文化在地化的內容
10/6(二)Franciscan B #81普惠 LM
MET:立基於理論且具文化意識的多語言道德推理
10/6(二)Franciscan B #82普惠 LM
評估並緩解英語至印地語機器翻譯中的性別誤植問題
10/6(二)Franciscan B #83普惠 LM
MMMG:一個全面且可靠的多任務多模態生成基準測試
10/6(二)Franciscan B #84多模態 LM
SynthDocBench:用於長情境視覺文件理解的受控基準測試
10/6(二)Franciscan B #85多模態 LM
Oolong:評估長情境推理與聚合能力
10/6(二)Franciscan B #86評測
Valley3:為電子商務擴展全模態基礎模型
10/6(二)Franciscan B #87多元領域與新應用
TSRouter:用於時間序列推理的動態模態—模型選擇
10/6(二)Franciscan B #88多模態 LM
FlexRouter:學習互補模型集合以實現彈性 LLM 路由
10/6(二)Franciscan B #89高效運算
FLINT:透過曲率感知資料選擇與微調,為 LoRA 建立影響力引導的主動學習框架
10/6(二)Franciscan B #90資料
邁向用於語言模型微調的主動合成資料生成
10/6(二)Franciscan C #91資料
適用於任意可微分目標的合成資料
10/6(二)Franciscan C #92資料
以對比解碼合成指令微調資料集
10/6(二)Franciscan C #93資料
從術語到圖表:用於科學圖表理解的視覺指令生成
10/6(二)Franciscan C #94多模態 LM
All-Weather VLM:提升視覺語言模型在惡劣成像條件下的穩健性
10/6(二)Franciscan C #95多模態 LM
用於抑制 VLM 幻覺的維納濾波法
10/6(二)Franciscan C #96多模態 LM
為何微調會助長幻覺,以及如何修正
10/6(二)Franciscan C #97訓練
微調並非失效而是過於分散:透過投影誤差訊號實現精確知識編輯
10/6(二)Franciscan C #98訓練
LLM 的知識十分脆弱:真實性表徵仰賴表面相似性
10/6(二)Franciscan C #99LM 與世界
當驗證失效時:組合式不可行主張如何逃過拒絕
10/6(二)Franciscan C #100LM 與世界
ReFIne:兼具可靠性、忠實性與可解釋性的可信賴大型推理模型框架
10/6(二)Grand Ballroom #101推論演算法
過濾式推理分數:以模型最具信心的推理軌跡評估推理品質
10/6(二)Grand Ballroom #102評測
理解並緩解過早自信,以提升 LLM 推理表現
10/6(二)Grand Ballroom #103推論演算法
反事實模擬訓練用於提升鏈式思考的忠實性
10/6(二)Grand Ballroom #104語言模型科學
在長鏈思考監督式微調中,資料重複優於資料擴增
10/6(二)Grand Ballroom #105資料
早期資料曝露可提升對後續微調的穩健性
10/6(二)Grand Ballroom #106資料
PivotRL:以低運算成本實現高準確率的代理式訓練後調整
10/6(二)Grand Ballroom #107訓練
V_{0.5}:以通用型價值模型作為稀疏強化學習展開的先驗
10/6(二)Grand Ballroom #108訓練
HeaPA:用於 LLM 強化學習的難度感知堆積採樣與同策略查詢擴增
10/6(二)Grand Ballroom #109訓練
對抗式獎勵稽核:主動偵測並緩解獎勵駭客行為
10/6(二)Grand Ballroom #110訓練
行為金絲雀:稽核強化學習微調中私有檢索情境的使用情況
10/6(二)Grand Ballroom #111安全
用於稽核 LLM 評判者行為依存性與誘發偏誤的統計框架
10/6(二)Grand Ballroom #112評測
FLY-EVAL++:用於具身系統中安全約束建模的循證式評估
10/6(二)Grand Ballroom #113LM 與具身
衡量可靠性的「九」數:飽和 GSM 基準測試中的樣本高效 LLM 評估
10/6(二)Grand Ballroom #114評測
LLM 中的隨機性錯覺
10/6(二)Grand Ballroom #115推論演算法
為何高斯擴散模型在離散資料上會失效?
10/6(二)Grand Ballroom #116學習演算法
衡量文字中的 AI「劣質內容」(slop)
10/6(二)Grand Ballroom #117評測
讓網格集束搜尋(Grid Beam Search)不再那麼貪婪
10/6(二)Grand Ballroom #118推論演算法
只編碼一次,從不解碼:重用音訊語言模型內部表徵以實現高效時間定位
10/6(二)Grand Ballroom #119高效運算
不僅止於詞彙:用於高效語言模型的組合式分詞法
ORAL10/6(二)Grand Ballroom #120高效運算
LLM 集成的推論擴展:以 Token 轉譯橋接不同的 Token 空間
10/6(二)Grand Ballroom #121推論演算法
Tiny Aya:銜接規模與多語言深度
10/6(二)Grand Ballroom #122普惠 LM
MameLoshnLM:意第緒語語言模型與評估基準測試
10/6(二)Grand Ballroom #123普惠 LM
嵌入模型的兩難:LLM 表現更好,但代價是什麼?
10/6(二)Grand Ballroom #124高效運算
LLM 會編碼自身的失敗:從生成前的激活值預測成功機率
10/6(二)Grand Ballroom #125推論演算法
為代理式程式撰寫擴展測試階段運算量
10/6(二)Grand Ballroom #126推論演算法
SWE-Replay:軟體工程代理的高效測試階段擴展
10/6(二)Grand Ballroom #127工具與程式
為平行程式碼學習推理式世界模型
10/6(二)Grand Ballroom #128工具與程式
SuperCoder:運用大型語言模型進行組合語言程式超最佳化
10/6(二)Grand Ballroom #129工具與程式
DarwinLM:大型語言模型的演化式結構化剪枝
10/6(二)Grand Ballroom #130高效運算
Sememe:大型語言模型任務感知深度剪枝的因果建模
10/6(二)Grand Ballroom #131高效運算
SEER:透過選擇性視覺—文字壓縮實現長情境推理
10/6(二)Grand Ballroom #132高效運算
Resa:透過稀疏自編碼器實現高效推理模型
10/6(二)Grand Ballroom #133高效運算
π²:源於結構的推理資料提升大型語言模型的長情境推理能力
10/6(二)Grand Ballroom #134資料
LakeQuest:跨資料湖的根植式問答三領域基準測試
10/6(二)Grand Ballroom #135多模態 LM
OfficeQA Pro:端到端根植式推理的企業級基準測試
10/6(二)Grand Ballroom #136工具與程式
在語言模型中共同演化結構化知識與推理
10/6(二)Grand Ballroom #137LM 與世界
SAKE:透過強化學習實現複雜 LLM 推理的結構化代理式知識外推
10/6(二)Grand Ballroom #138工具與程式
CABLE:透過互補式前因連結與擴展延伸記憶檢索的觸及範圍
10/6(二)Grand Ballroom #139工具與程式
RecaLLM:以明確的情境內檢索處理「迷失於思考中」現象
10/6(二)Grand Ballroom #140LM 與世界
無法遺忘:主動干擾揭示 LLM 工作記憶超越情境長度的限制
10/6(二)Grand Ballroom #141心智、大腦、哲學、法律
情節記憶是否有助於縮小句法對比敏感度中的詞彙頻率落差?一項運用檢索增強語言模型的測試
10/6(二)Grand Ballroom #142心智、大腦、哲學、法律
Combee:為自我改進的 LLM 代理擴展平行提示學習
10/6(二)Imperial Ballroom #1訓練
訓練具主動性與個人化的 LLM 代理
10/6(二)Imperial Ballroom #2LM 與互動
真實與模擬人類群體中的身分認同、合作與框架效應
10/6(二)Imperial Ballroom #3LM 與世界
模擬組織化群體行為:新框架、基準測試與分析
10/6(二)Imperial Ballroom #4LM 與世界
人類認知與行為的小型基礎模型
10/6(二)Imperial Ballroom #5心智、大腦、哲學、法律
LLM 決策中的表層信念
10/6(二)Imperial Ballroom #6心智、大腦、哲學、法律
LLM 何時會承認錯誤?理解模型信念在撤回中的角色
ORAL10/6(二)Imperial Ballroom #8心智、大腦、哲學、法律
何時該說蘋果是紅色的:人類遵循內省規則,VLM 則不然
10/6(二)Imperial Ballroom #9心智、大腦、哲學、法律
天生過度自信:LLM 中言語化信心膨脹的機制觀點
10/6(二)Imperial Ballroom #10語言模型科學
跨模型電路遷移的可微分保真度對齊
10/6(二)Imperial Ballroom #11語言模型科學
ADAG:自動描述歸因圖
10/6(二)Imperial Ballroom #12語言模型科學
Data Canvas:代理式資料工程的來源導向框架
10/6(二)Imperial Ballroom #13工具與程式
最佳化器即代理:跨提示、程式與機器學習工作流程的推理驅動搜尋
10/6(二)Imperial Ballroom #14工具與程式
遞迴代理最佳化
10/6(二)Imperial Ballroom #15訓練
Agent0:透過工具整合推理,從零資料釋放自我演化代理
10/6(二)Imperial Ballroom #16工具與程式
SkillFoundry:從異質科學資源建構自我演化代理技能庫
10/6(二)Imperial Ballroom #17工具與程式
SkillFlow:可擴展且高效的代理技能檢索系統
10/6(二)Imperial Ballroom #18工具與程式
CoSearch:透過強化學習聯合訓練代理式搜尋的推理與文件排序
10/6(二)Imperial Ballroom #19工具與程式
迷失在迷宮中:克服長時程代理式搜尋的上下文限制
10/6(二)Imperial Ballroom #20工具與程式
別失去頭緒:以認知資源自我分配賦能長時程 LLM 代理
10/6(二)Imperial Ballroom #21工具與程式
AdaPlanBench:在世界與使用者限制下評估大型語言模型代理的自適應規劃
10/6(二)Imperial Ballroom #22推論演算法
SIMMER:以世界模型為 LLM 可執行規劃中的潛在失敗建立基準
10/6(二)Imperial Ballroom #23推論演算法
透過型別化失敗標記進行失敗感知滲透測試:從校準預測到結構化復原
10/6(二)Imperial Ballroom #24安全
用於資料代理改進的診斷性失敗分類法與軌跡評判器
10/6(二)Imperial Ballroom #25工具與程式
MedAction:邁向主動式多輪臨床診斷 LLM
10/6(二)Imperial Ballroom #26多元領域與新應用
MedConceal:部分可觀測性下臨床隱性顧慮推理的基準測試
10/6(二)Imperial Ballroom #27多元領域與新應用
JMedEthicBench:日語醫學倫理對齊的多輪對抗式基準測試
10/6(二)Imperial Ballroom #28多元領域與新應用
TRIDENT:金融、醫學與法律領域 LLM 安全性基準測試
10/6(二)Imperial Ballroom #29安全
LLM 也會「腦腐」:一項針對 Twitter/X 的先導研究
10/6(二)Imperial Ballroom #30資料
我們能信任憶阻器上的 LLM 嗎?深入探討非理想條件下的推理能力
10/6(二)Imperial Ballroom #31大型 LM 工程
上下文中的疊加現象:大型語言模型中類人的工作記憶干擾
10/6(二)Imperial Ballroom #32心智、大腦、哲學、法律
疊加的幻象?語言模型中潛在思考的原理性分析
10/6(二)Imperial Ballroom #33語言模型科學
稀疏自編碼器能捕捉概念流形嗎?
10/6(二)Imperial Ballroom #34語言模型科學
大型語言模型中特徵空間的語意結構
10/6(二)Imperial Ballroom #35語言模型科學
LLM2Vec-Gen:來自大型語言模型的生成式嵌入
10/6(二)Imperial Ballroom #36學習演算法
SMETA-ZSL:用於零樣本威脅分類的語意元對齊
10/6(二)Imperial Ballroom #37安全
GRIP:透過幾何路由限制實現與演算法無關的混合專家機器遺忘
10/6(二)Imperial Ballroom #38學習演算法
遺忘去遺忘:注意力匯聚點作為 LLM 遺忘後門攻擊的入口
10/6(二)Imperial Ballroom #39安全
ContextLeak:稽核私有上下文學習方法中的洩漏
10/6(二)Imperial Ballroom #40安全
LLM 中免訓練與基於訓練的意圖分類:準確性、穩健性與失敗模式
10/6(二)Imperial Ballroom #41評測
GLiGuard:LLM 防護的基模式條件式分類
10/6(二)Imperial Ballroom #42安全
Guard Vector:透過任務向量組合與串流感知前綴 SFT 超越英語 LLM 護欄
10/6(二)Imperial Ballroom #43安全
強大卻脆弱:簡單攻擊即可攻破基於推理的安全護欄
10/6(二)Imperial Ballroom #44安全
理解安全去對齊對大型語言模型的影響
10/6(二)Imperial Ballroom #45安全
逃離納許陷阱:大型語言模型中策略推理的結構性估計與對齊
10/6(二)Imperial Ballroom #46LM 與世界
透過與人類群體對齊,使多重生成式代理更多樣化
10/6(二)Imperial Ballroom #47普惠 LM
大型語言模型能在教育內容生成上匹敵人類多樣性嗎?
10/6(二)Imperial Ballroom #48LM 與世界
分岔提示的花園:使用者如何在故事生成中探索敘事空間
10/6(二)Imperial Ballroom #49LM 與互動
代理即評判者的多語言提示在地化:需求層級評估中的語言與骨幹模型敏感度
10/6(二)Imperial Ballroom #50普惠 LM
行動勝於言語:衡量使用工具代理中的跨語言政策保留度
10/6(二)Imperial Ballroom #51普惠 LM
多語言嵌入探針無法跨學習者語料庫泛化
10/6(二)Imperial Ballroom #52普惠 LM
迷失於巴別塔:LLM 中偶然性多語言的不良影響
10/6(二)Imperial Ballroom #53普惠 LM
英語並非唯一所需:系統性探討多語言性在 LLM 後訓練中的角色
10/6(二)Imperial Ballroom #54普惠 LM
MaLA:用於大型語言模型大規模語言調適的語料庫與資料混合
10/6(二)Imperial Ballroom #55普惠 LM
以封面評斷一本書:探討多模態 LLM 在多頁手寫文件轉錄上的應用
10/6(二)Imperial Ballroom #56多模態 LM
ComDoc:文件檢索增強生成的綜合基準測試
10/6(二)Imperial Ballroom #57LM 與世界
透過查詢涵蓋率與陳述可驗證性邁向與查詢無關的 RAG 評估
10/6(二)Imperial Ballroom #58LM 與世界
OSCAR:協同自我驗證與跨路徑精修
10/6(二)Imperial Ballroom #59LM 與世界
SALA:用於開放式文本生成的語法感知 Logit 調整
10/6(二)Imperial Ballroom #60推論演算法
關係子句依附於何處?探討大型音訊語言模型的韻律與語意敏感度
10/6(二)Imperial Ballroom #61心智、大腦、哲學、法律
共享語法的共享電路:追蹤跨語言的主詞—動詞一致性
10/6(二)Imperial Ballroom #62語言模型科學
漸進式語碼轉換作為 LLM 推論時跨語言表徵對齊的方法
10/6(二)Imperial Ballroom #63普惠 LM
Verb-ICL:重新思考結構化預測的上下文學習
10/6(二)Imperial Ballroom #64訓練
RIMS:透過平滑多配對聚合進行偏好最佳化,適用於小規模 LLM 檢索增強生成
10/6(二)Imperial Ballroom #65訓練
用於裝置端檢索增強生成的統一模型與文件表徵
10/6(二)Imperial Ballroom #66LM 與世界
回歸基礎:讓對話代理僅憑檢索與生成即可記憶
10/6(二)Imperial Ballroom #67LM 與世界
是什麼讓檢索在教學對話標註上發揮作用?索引粒度勝於檢索器調適
10/6(二)Imperial Ballroom #68LM 與世界
KT4EQG:透過知識追蹤生成個人化練習題
10/6(二)Imperial Ballroom #69LM 與世界
SERUM:用於使用者建模的狀態擷取與精修
10/6(二)Imperial Ballroom #70多模態 LM
EgoMemReason:長時程第一人稱視訊理解的記憶驅動推理基準測試
10/6(二)Imperial Ballroom #71多模態 LM
MMEB-V3:衡量全模態嵌入模型的效能落差
10/6(二)Imperial Ballroom #72多模態 LM
可解釋 AI 生成影像偵測獎勵基準測試
10/6(二)Imperial Ballroom #73安全
以影像生成進行推理
10/6(二)Franciscan A #74多模態 LM
FronTalk:以多模態回饋將前端開發基準化為對話式程式碼生成
10/6(二)Franciscan A #75工具與程式
空談容易,溝通困難:多代理協商中的動態基礎建立失敗與修復
10/6(二)Franciscan A #76LM 與互動
非同步軟體工程代理的有效策略
10/6(二)Franciscan A #77工具與程式
HAI-Agent:透過交接介入改善長時程軟體工程
10/6(二)Franciscan A #78工具與程式
從 SWE-ZERO 到 SWE-HERO:軟體工程代理從免執行到基於執行的微調
10/6(二)Franciscan A #79工具與程式
MechMath:以 Sorrifier 驅動的形式化分解工作流程應用於自動定理證明
10/6(二)Franciscan A #80多元領域與新應用
LeanGeo:在 Lean 中形式化競賽幾何問題
10/6(二)Franciscan B #81多元領域與新應用
信用卡、困惑、計算與後果:我們能從語言模型的推理中發現什麼?
10/6(二)Franciscan B #82多元領域與新應用
CresOWLve:基於真實世界知識的創意問題解決基準測試
10/6(二)Franciscan B #83評測
DRBENCHER:你的代理能辨識實體、檢索其屬性並完成運算嗎?
10/6(二)Franciscan B #84評測
InfiniteScienceGym:一個用於科學分析的無界、程序生成式基準測試
10/6(二)Franciscan B #85多元領域與新應用
MegaScience:推展用於科學推理的開放後訓練資料集之前沿
10/6(二)Franciscan B #86資料
LiteResearcher:用於深度研究代理的可擴展代理式強化學習訓練框架
10/6(二)Franciscan B #87工具與程式
面向長時程代理任務平行擴展的代理式聚合方法
10/6(二)Franciscan B #88推論演算法
FutureWeaver:以模組化協作規劃多代理系統的測試時運算
10/6(二)Franciscan B #89推論演算法
測試時擴展使過度訓練成為運算最佳選擇
10/6(二)Franciscan B #90語言模型科學
大型語言模型的相對縮放律
10/6(二)Franciscan C #91語言模型科學
成長的陣痛:透過固定參數校準實現可擴展且高效的 LLM 基準測試
10/6(二)Franciscan C #92評測
跨基準測試通用能力的低成本估計
10/6(二)Franciscan C #93評測
RankBALD:面向語言模型的排名對齊主動評估方法
10/6(二)Franciscan C #94評測
LORA-CRAFT:透過凍結 Tucker 分解對預訓練注意力權重進行跨層秩適應
10/6(二)Franciscan C #95高效運算
Hyperloop Transformers
10/6(二)Franciscan C #96學習演算法
HyperThink:用於高效推理的文字轉參數超網路
10/6(二)Franciscan C #97高效運算
Think Right:透過適應性、注意力導向的壓縮學習緩解思考不足與過度思考
10/6(二)Franciscan C #98高效運算
QLPO:面向長度感知策略最佳化的象限加權採樣
10/6(二)Franciscan C #99高效運算
FIPO:以未來 KL 影響策略最佳化引導深度推理
10/6(二)Franciscan C #100訓練
從零學習:消失優勢下的策略最佳化
10/6(二)Grand Ballroom #101訓練
延遲、停滯或崩潰:評估系統性驗證錯誤對 RLVR 的影響
10/6(二)Grand Ballroom #102訓練
從 RLVR 到 RLSVR:任務轉換為開放式 LLM 自我改進誘發自我可驗證獎勵
10/6(二)Grand Ballroom #103訓練
混合還是合併:邁向大型語言模型的多領域強化學習
10/6(二)Grand Ballroom #104訓練
透過兩階段蒸餾建構多任務代理式 LLM
10/6(二)Grand Ballroom #105訓練
探索多輪自主代理在策略蒸餾中的時序課程學習
10/6(二)Grand Ballroom #106訓練
重新檢視在策略蒸餾:實證失敗模式與簡單修正方法
10/6(二)Grand Ballroom #107訓練
語言模型知識蒸餾中的記憶動態
10/6(二)Grand Ballroom #108語言模型科學
以解碼受限集束搜尋估計語言模型的近逐字萃取風險
10/6(二)Grand Ballroom #109安全
ReLay:個人化 LLM 生成的簡明語言摘要能促進健康資訊理解,但代價是什麼?
10/6(二)Grand Ballroom #110多元領域與新應用
AI 能真正代表你的聲音進行審議嗎?一項針對 LLM 大規模意見彙整的全面研究
10/6(二)Grand Ballroom #111LM 與世界
LLM 作為內容策展人:跨供應商與平台的推薦偏誤大規模稽核
10/6(二)Grand Ballroom #112評測
單一文化偏誤:大型語言模型中相關聯的偏誤導致招募中不平等的系統性排除率
10/6(二)Grand Ballroom #113評測
探討量化大型語言模型中的社會偏誤變化
10/6(二)Grand Ballroom #114高效運算
MuonQ:透過方向保真度最佳化強化低位元 Muon 量化
10/6(二)Grand Ballroom #115高效運算
Muon^p:具分數譜冪次的 Muon
10/6(二)Grand Ballroom #116大型 LM 工程
譜主路徑:大型語言模型中線性表徵形成的譜觀點
10/6(二)Grand Ballroom #117語言模型科學
PCA 引導的活化縮放:對 LLM 諂媚行為進行單調雙向控制
10/6(二)Grand Ballroom #118語言模型科學
面向多元化 LLM 對齊的溢出感知多價值導引
10/6(二)Grand Ballroom #119普惠 LM
面向大型語言模型的 Overton 多元化強化學習
10/6(二)Grand Ballroom #120普惠 LM
透過多目標強化學習與大型語言模型實現柏拉圖最適 RTL 程式碼生成
10/6(二)Grand Ballroom #121多元領域與新應用
以自我引導擴展自我對弈
10/6(二)Grand Ballroom #122訓練
多少回溯才夠?探討 SFT 與 RL 在強化 LLM 推理中的交互作用
10/6(二)Grand Ballroom #123訓練
什麼造就良好的多語推理?以可測量特徵解構推理軌跡
10/6(二)Grand Ballroom #124普惠 LM
資料選擇對數學推理的效果如何取決於模型容量
10/6(二)Grand Ballroom #125資料
(如何)學習率調節災難性過度訓練
10/6(二)Grand Ballroom #126語言模型科學
GRRR:解碼器 LLM 後訓練中重塑、旋轉與路由的幾何學
10/6(二)Grand Ballroom #127語言模型科學
準確率相同,幾何結構不同:演化策略與 GRPO 在 LLM 後訓練中的比較
10/6(二)Grand Ballroom #128訓練
透過幾何對齊恢復微調後多模態 LLM 的泛化能力
10/6(二)Grand Ballroom #129學習演算法
泛化山脊:自然語言生成中的資訊流
10/6(二)Grand Ballroom #130語言模型科學
Transformer 看與做:複製作為學習類比推理的中間步驟
10/6(二)Grand Ballroom #131心智、大腦、哲學、法律
Transformer 通用推理的障礙(以及如何克服)
10/6(二)Grand Ballroom #132語言模型科學
Transformer 長度泛化的代數分解理論
10/6(二)Grand Ballroom #133語言模型科學
Olmo Hybrid:從理論到實務,再回到理論
10/6(二)Grand Ballroom #134學習演算法
Cylon:非同步線性注意力
10/6(二)Grand Ballroom #135大型 LM 工程
切換式線性注意力
10/6(二)Grand Ballroom #136學習演算法
IndexCache:透過跨層索引重複使用加速稀疏注意力
10/6(二)Grand Ballroom #137高效運算
透過漸進樹狀草擬的推測解碼釋放自迴歸語言模型中的平行性
10/6(二)Grand Ballroom #138高效運算
更快的超詞分詞
10/6(二)Grand Ballroom #139高效運算
注意力匯與殘差匯的統一觀點:離群值驅動的重新縮放對大型語言模型訓練不可或缺
ORAL10/6(二)Grand Ballroom #140大型 LM 工程
衡量語言模型預訓練過程中與任務無關的訓練資料影響力
10/6(二)Grand Ballroom #141資料
隨時更聰明:面向持續 LLM 改進的環境驅動動態策略
10/6(二)Grand Ballroom #142學習演算法
PromptBridge:大型語言模型的跨模型提示遷移
10/6(二)Grand Ballroom #143訓練
手語模型的音韻感知
ORAL10/6(二)Grand Ballroom #144多模態 LM
大型語言模型中的歸因偏誤
ORAL10/6(二)Grand Ballroom #145評測
熬煉後的經驗改善 LLM 代理的測試時推論
10/7(三)Imperial Ballroom #1推論演算法
自學習診斷代理中推理與雙重記憶的聯合最佳化
10/7(三)Imperial Ballroom #2多元領域與新應用
PolicyBank:為 LLM 代理演化政策理解
10/7(三)Imperial Ballroom #3工具與程式
透過協作式自我對弈學習可操控的澄清政策
10/7(三)Imperial Ballroom #4LM 與互動
StoryScope:探究 AI 小說中的獨特風格
10/7(三)Imperial Ballroom #5多元領域與新應用
LLM 能夠內省嗎?一次現實檢驗
10/7(三)Imperial Ballroom #6心智、大腦、哲學、法律
LLM 能從自己說過的話中受益嗎?
10/7(三)Imperial Ballroom #7LM 與互動
對話壓力如何改變大型語言模型的信念:一個隱藏狀態邊界的觀點
10/7(三)Imperial Ballroom #8LM 與互動
將對話作為臨床問診的測量工具:可觀察的階段結構與部分可觀察的病人狀態
10/7(三)Imperial Ballroom #9多元領域與新應用
對數分數,冪律發現:在基於代理的評估中釐清測量與涵蓋範圍的差異
10/7(三)Imperial Ballroom #10評測
自然語言處理領域中多語言、情境化評估的現況與未來
10/7(三)Imperial Ballroom #11普惠 LM
AnchorBench:針對 LLM 錨定效應的多路徑基準測試
10/7(三)Imperial Ballroom #12心智、大腦、哲學、法律
TEMPER:測試量化推理中的情緒擾動
10/7(三)Imperial Ballroom #13評測
使用大型語言模型對 K-5 學生敘事進行自動化評量的基準測試
10/7(三)Imperial Ballroom #14多元領域與新應用
Qworld:針對 LLM 的題目專屬評估準則
10/7(三)Imperial Ballroom #15評測
天下沒有白吃的標籤:LLM 作為評審在缺乏人類基準時的侷限
10/7(三)Imperial Ballroom #16評測
誰來查核引註?法律幻覺偵測的基準測試
10/7(三)Imperial Ballroom #17LM 與世界
科學出版代理中的 BibTeX 引註錯誤:評估與緩解
10/7(三)Imperial Ballroom #18LM 與世界
評估指標能否偵測出文言文譯英中的錯誤?
10/7(三)Imperial Ballroom #19普惠 LM
TokEval:一套 tokenizer 分析工具組
10/7(三)Imperial Ballroom #20評測
為語言模型解碎:一種基於可解釋性的詞彙擴充方法
10/7(三)Imperial Ballroom #21語言模型科學
趨同演化:不同語言模型如何學到相似的數字表徵
10/7(三)Imperial Ballroom #22語言模型科學
透過損失曲線分解實現預訓練動態的由下而上可解釋性
10/7(三)Imperial Ballroom #23語言模型科學
語言模型學到什麼、何時學到?隱性課程假說
ORAL10/7(三)Imperial Ballroom #24語言模型科學
以稀疏自編碼器理解大型語言模型中的初始效應
10/7(三)Imperial Ballroom #25語言模型科學
擴散式與自回歸語言模型所生成文本的差異
10/7(三)Imperial Ballroom #26學習演算法
局部自信,全域卡關:擴散語言模型中的品質-探索兩難
10/7(三)Imperial Ballroom #27學習演算法
以跨模型分歧作為無標籤正確性訊號
10/7(三)Imperial Ballroom #28評測
以熵質心作為測試時擴展的內在獎勵
10/7(三)Imperial Ballroom #29推論演算法
針對信心邊界的過程監督,實現經校準的 LLM 推理
10/7(三)Imperial Ballroom #30訓練
透過建模多選題問答的可解性,提升過程正確的思維鏈推理
10/7(三)Imperial Ballroom #31訓練
視覺語言模型的推理動態與監控模態依賴的侷限
10/7(三)Imperial Ballroom #32多模態 LM
MonitorBench:針對大型語言模型思維鏈可監控性的綜合基準測試
10/7(三)Imperial Ballroom #33評測
可讀性不等於可解釋性:評估思維鏈推理步驟中的判定重要性與實際重要性
10/7(三)Imperial Ballroom #34語言模型科學
為何自我蒸餾有時會削弱 LLM 的推理能力?
10/7(三)Imperial Ballroom #35訓練
超越軌跡模仿:針對 LLM 推理的策略導向政策最佳化
10/7(三)Imperial Ballroom #36訓練
演化式程式化技能網路
10/7(三)Imperial Ballroom #37工具與程式
CoEvoSkills:透過共演化驗證實現代理技能的自我演化
10/7(三)Imperial Ballroom #38工具與程式
REVERE:反思式演化研究工程師
10/7(三)Imperial Ballroom #39工具與程式
p1:以更少提示實現更好的提示最佳化
10/7(三)Imperial Ballroom #40訓練
與什麼比較?反事實提示的基準與評估指標
10/7(三)Imperial Ballroom #41評測
問法決定一切:LLM 中與性別相關的語言偏誤
10/7(三)Imperial Ballroom #42評測
伸手探入合唱團:自由列舉法揭露 LLM 集成中各異的模型聲音
10/7(三)Imperial Ballroom #43評測
在全雙工語音模型中解放 LLM 能力
10/7(三)Imperial Ballroom #44多模態 LM
學習繪製 ASCII 圖能提升語言模型的空間推理能力
10/7(三)Imperial Ballroom #45推論演算法
極座標探針能以線性方式從 LLM 中解碼語意結構
10/7(三)Imperial Ballroom #46語言模型科學
大型語言模型在情境學習過程中會重組其表徵幾何結構
10/7(三)Imperial Ballroom #47語言模型科學
將情境學習視為隱性政策梯度
10/7(三)Imperial Ballroom #48語言模型科學
GradAlign:針對 LLM 強化學習的梯度對齊資料選擇法
10/7(三)Imperial Ballroom #49資料
LLM 的風險樣貌剖析與調節
10/7(三)Imperial Ballroom #50訓練
故事塑造代理:LLM 行為中的敘事先驗
10/7(三)Imperial Ballroom #51評測
測量 LLM 指令中的語用影響力
10/7(三)Imperial Ballroom #52評測
HieraSuite:一套用於建構多用途系統-使用者指令層級的整合工具組
10/7(三)Imperial Ballroom #53安全
LogicIF:邁向複雜邏輯指令遵循
10/7(三)Imperial Ballroom #54訓練
Quokka:透過不變量合成,以 LLM 加速程式驗證
10/7(三)Imperial Ballroom #55工具與程式
BugScope:學習像人類一樣偵測程式錯誤
ORAL10/7(三)Imperial Ballroom #56工具與程式
程式碼代理不知道何時該動手
10/7(三)Imperial Ballroom #57工具與程式
誰來監督基準測試?LLM 代理基準測試的自動化稽核
10/7(三)Imperial Ballroom #58評測
WildTableBench:在真實情境下對多模態基礎模型的表格理解能力進行基準測試
10/7(三)Imperial Ballroom #60多模態 LM
SciTaRC:一套帶有計畫標註的科學表格問答基準測試,用於語言推理與複雜計算
10/7(三)Imperial Ballroom #61評測
ArtifactLinker:連結科學構件以自動發現最先進成果
10/7(三)Imperial Ballroom #62工具與程式
從論文到全景:大規模建構科學文獻的層級結構
10/7(三)Imperial Ballroom #63多元領域與新應用
「文件即圖像」表徵法在科學檢索上表現不足
10/7(三)Imperial Ballroom #64多模態 LM
透過預測性嵌入實現多模態潛在推理
10/7(三)Imperial Ballroom #65多模態 LM
VERIFY:針對多模態推理忠實度的視覺推理基準測試
10/7(三)Imperial Ballroom #66多模態 LM
AVMeme Exam:針對 LLM 情境與文化知識及思維的多模態、多語言、多文化基準測試
10/7(三)Imperial Ballroom #67多模態 LM
NormViz:將多模態推理根植於全球文化的基準測試與框架
10/7(三)Imperial Ballroom #68多模態 LM
VisCodeBench:一套反映真實世界實務、用於文字轉視覺化的全新基準資料集
10/7(三)Imperial Ballroom #69工具與程式
CT-ΔBench:利用視覺語言模型進行縱向 3D 醫學影像差異報告的基準測試
10/7(三)Imperial Ballroom #70多元領域與新應用
CT Open:一個開放存取、無污染的即時平台,用於臨床試驗結果預測的開放挑戰
10/7(三)Imperial Ballroom #71多元領域與新應用
SatIR:可擴展、高召回率、基於約束滿足的臨床試驗配對資訊檢索
10/7(三)Imperial Ballroom #72多元領域與新應用
TierCache:針對結構化查詢生成的多粒度語意快取框架
10/7(三)Imperial Ballroom #73大型 LM 工程
透過語意空間中的雙階段信心測量,緩解檢索增強生成的知識衝突
10/7(三)Franciscan A #74LM 與世界
KARL:透過知識邊界感知強化學習緩解 LLM 幻覺
10/7(三)Franciscan A #75LM 與世界
幻覺自我對弈:透過演化生成器自舉強化偵測器
10/7(三)Franciscan A #76LM 與世界
高效能強化學習環境的自動生成
10/7(三)Franciscan A #77大型 LM 工程
什麼造就一筆交易?用 LLM 代理模擬端到端的賣家—買家零售動態
10/7(三)Franciscan A #78LM 與世界
CivBench:基於進程的評估,測試 LLM 在《文明帝國 V》中的策略決策能力
10/7(三)Franciscan A #79評測
VehicleMemBench:車載代理多使用者長期記憶的可執行基準測試
10/7(三)Franciscan A #80工具與程式
iOSWorld:具個人化使用者身分與記憶的真實 iOS 環境,用於手機代理基準測試
10/7(三)Franciscan B #81工具與程式
InjecMEM:針對 LLM 代理記憶系統的記憶注入攻擊
10/7(三)Franciscan B #82安全
InfMem:為長情境代理學習系統二式記憶控制
10/7(三)Franciscan B #83LM 與世界
思維速記:透過熵值引導的超級 token 壓縮 LLM 推理
10/7(三)Franciscan B #85高效運算
ReflCtrl:透過表徵工程高效控制 LLM 反思行為
10/7(三)Franciscan B #86高效運算
RankGuide:張量秩引導的路由與引導機制,實現高效推理
10/7(三)Franciscan B #87高效運算
超越 Logit 調整:長尾重排序的殘差分解框架
10/7(三)Franciscan B #88多元領域與新應用
透過機率偏好基底的不確定性感知變分獎勵分解,實現 LLM 個人化
10/7(三)Franciscan B #89LM 與互動
CIDER:用於隱私偏好對齊的情境揭露邊界資料集
10/7(三)Franciscan B #90安全
SOTOPIA-TOM:以心智理論評估多代理互動中的隱私與資訊管理
10/7(三)Franciscan C #91LM 與互動
SNEAK:評估大型語言模型中的策略性溝通與資訊洩漏
10/7(三)Franciscan C #92LM 與互動
StateBridge:免訓練的隱藏狀態對齊,實現 LLM 多代理系統的潛在溝通
10/7(三)Franciscan C #93LM 與互動
學習在基於語言的多代理溝通中插話
10/7(三)Franciscan C #94LM 與互動
當情境推論失效時:互動式指令遵循中的可取消性
10/7(三)Franciscan C #95LM 與互動
以自我協商契約承諾合作
10/7(三)Franciscan C #96LM 與互動
代理系統對抗對抗性誘發有害行為的穩健性基準測試
10/7(三)Franciscan C #97安全
TraceSafe:LLM 護欄在多步驟工具呼叫軌跡上的系統性評估
10/7(三)Franciscan C #98安全
為什麼安全護欄會隨語言而失效?
10/7(三)Franciscan C #99安全
一次一個詞:漸進式補全分解破解 LLM 安全性
10/7(三)Franciscan C #100安全
大型語言模型越獄成功的最小化、局部性因果解釋
10/7(三)Grand Ballroom #101安全
引導向量的安全代價是可分離且可降低的
10/7(三)Grand Ballroom #102安全
RefusalGuard:LLM 安全性的保幾何微調
10/7(三)Grand Ballroom #103安全
解耦對齊,實現穩健的即插即用調適
10/7(三)Grand Ballroom #104安全
FPEdit:透過局部參數編輯實現穩健的 LLM 指紋辨識
10/7(三)Grand Ballroom #105安全
蒸餾以偵測:透過卡匣蒸餾揭露 LLM 中的隱蔽偏誤
10/7(三)Grand Ballroom #106安全
一例即可偏誤全體:單樣本 GRPO 的破壞性
10/7(三)Grand Ballroom #108安全
CLIP 是鬥雞眼嗎?揭露並緩解 CLIP 家族中的中心偏誤
10/7(三)Grand Ballroom #109多模態 LM
超越語意:重新發現視覺語言模型中的空間意識
10/7(三)Grand Ballroom #110多模態 LM
強化學習究竟改善了視覺推理的哪些能力?一項科學怪人式分析
10/7(三)Grand Ballroom #111多模態 LM
Apriel-Reasoner:面向通用且高效推理的強化學習後訓練
10/7(三)Grand Ballroom #112訓練
重新思考推理 SFT 中的泛化能力:針對最佳化、資料與模型能力的條件性分析
ORAL10/7(三)Grand Ballroom #113訓練
論推理模式在長思維鏈監督式微調泛化差異中的角色
10/7(三)Grand Ballroom #114訓練
循環、思考、泛化:循環深度 Transformer 中的隱式推理
10/7(三)Grand Ballroom #115學習演算法
Transformer 如何透過多 token 預測學會規劃
10/7(三)Grand Ballroom #116語言模型科學
MLP 即 Hebbian:為 Transformer 建構高效的事實儲存 MLP
10/7(三)Grand Ballroom #117語言模型科學
大規模程序性知識改善推理能力
10/7(三)Grand Ballroom #118LM 與世界
QED-Nano:教導小型模型證明困難定理
10/7(三)Grand Ballroom #119多元領域與新應用
LiveMathematicianBench:結合證明草圖的研究級數學推理即時基準測試
10/7(三)Grand Ballroom #120多元領域與新應用
MathDuels:會不斷成長的自我對弈基準測試
10/7(三)Grand Ballroom #121多元領域與新應用
BigCodeArena:可執行程式碼生成評估平台
10/7(三)Grand Ballroom #122工具與程式
Meta-Harness:模型鷹架的端到端最佳化
10/7(三)Grand Ballroom #123工具與程式
語言模型代理中的獎勵駭客行為:重新審視 AI 安全網格世界
10/7(三)Grand Ballroom #124安全
開始分類:LLM 強化學習的類別式評論者
10/7(三)Grand Ballroom #125訓練
源自稀疏真實世界結果的評分規準監督評論者
10/7(三)Grand Ballroom #126訓練
從評分規準到 Token:銜接指令遵循任務中回應層級評分規準與 Token 層級獎勵
10/7(三)Grand Ballroom #127訓練
重新思考獎勵監督:評分規準條件式自我蒸餾
10/7(三)Grand Ballroom #128訓練
透過樣本路由統一群組相對與自我蒸餾策略最佳化
10/7(三)Grand Ballroom #129訓練
Headroom-Drift Replay:GRPO 中原則性重播控制的基本單元
10/7(三)Grand Ballroom #130訓練
Faithful GRPO:透過約束策略最佳化改善多模態語言模型的視覺空間推理
10/7(三)Grand Ballroom #131多模態 LM
OpenVLThinkerV2:面向多領域視覺任務的通用型多模態推理模型
10/7(三)Grand Ballroom #132多模態 LM
Bagpiper:透過豐富字幕描述解決開放式音訊任務
10/7(三)Grand Ballroom #133多模態 LM
TEMPURA:面向動作推理的時間事件遮罩預測與理解
10/7(三)Grand Ballroom #134多模態 LM
FOCUS:高效視覺語言理解的閉環注意力回饋
10/7(三)Grand Ballroom #135高效運算
批次自適應剪枝:面向語言推理模型的週期性神經元活化感知權重剪枝
10/7(三)Grand Ballroom #136高效運算
用於因果迴路發現的多粒度節點剪枝
10/7(三)Grand Ballroom #137語言模型科學
當更少層數破壞更多鏈條:層剪枝損害 LLM 的測試期擴展能力
10/7(三)Grand Ballroom #138高效運算
Lang-Prune:為多語言大型語言模型解鎖公平且強大的剪枝
10/7(三)Grand Ballroom #139高效運算
ADMM-Q:用於大型語言模型訓練後量化之改進版海森矩陣權重量化器
10/7(三)Grand Ballroom #140高效運算
QVAC Genesis III:用於高效語言模型預訓練之大規模、高品質開放合成 STEM 語料庫
10/7(三)Grand Ballroom #141資料
MidTool:面向代理式工具使用的中期訓練資料合成
10/7(三)Grand Ballroom #142資料
建立工具的 LLM 代理,從保留工具中獲益甚微
10/7(三)Grand Ballroom #143工具與程式
人類與 LLM 在信念修正上是否存在分歧?來自貝氏分析的證據
ORAL10/7(三)Grand Ballroom #144心智、大腦、哲學、法律
透過注意力頭重新加權實現 LLM 的資料高效調適
10/7(三)Imperial Ballroom #1高效運算
一種先驗感知指標,用於高效區分大型語言模型中的記憶與泛化
10/7(三)Imperial Ballroom #2語言模型科學
語言模型知道卻未說出的事:用於泛化的非生成式先驗萃取
10/7(三)Imperial Ballroom #3語言模型科學
超越羅塞塔石碑:泛化動態中的統一力量
ORAL10/7(三)Imperial Ballroom #4語言模型科學
對多語言大型語言模型生成內容中翻譯腔的調查研究
10/7(三)Imperial Ballroom #5普惠 LM
用於社會科學的多語言代理式世界建模
10/7(三)Imperial Ballroom #6LM 與世界
社會世界模型
10/7(三)Imperial Ballroom #7心智、大腦、哲學、法律
用於世界建模的神經符號協同(Neuro-Symbolic Synergy)
10/7(三)Imperial Ballroom #8LM 與世界
神經符號 PRM:透過結構化推理軌跡與符號驗證提升科學推理能力
10/7(三)Imperial Ballroom #9推論演算法
從健全推理得出正確答案:語言模型的可驗證過程監督
10/7(三)Imperial Ballroom #10訓練
Odysseus:透過強化學習將視覺語言模型擴展至遊戲中 100 輪以上的決策任務
10/7(三)Imperial Ballroom #11LM 與具身
從人機互動中學習下一步行動預測器
10/7(三)Imperial Ballroom #12LM 與互動
FinTrace:針對長時間跨度金融任務的 LLM 工具呼叫全面軌跡層級評估
10/7(三)Imperial Ballroom #13多元領域與新應用
YC-Bench:針對長期規劃與一致執行能力的 AI 代理基準測試
10/7(三)Imperial Ballroom #14評測
DeliveryBench:代理能在模擬世界中賺取利潤嗎?
10/7(三)Imperial Ballroom #15LM 與世界
UrbanLLMind:以開放權重模型驅動的可擴展 LLM 城市移動模擬
10/7(三)Imperial Ballroom #16LM 與世界
Agent Bazaar:在多代理市場中實現經濟對齊
10/7(三)Imperial Ballroom #17LM 與世界
合作特徵能預測多代理 LLM 團隊在 AI for Science 工作流程中的表現
10/7(三)Imperial Ballroom #18LM 與互動
LLM 代理中的溝通與驗證:邁向資訊不對稱下的協作
10/7(三)Imperial Ballroom #19LM 與互動
協作落差:開放世界代理式合作的探索與基準測試
10/7(三)Imperial Ballroom #20LM 與互動
群體演化代理:透過經驗分享實現開放式自我改進
10/7(三)Imperial Ballroom #21LM 與互動
在神經科學資料到發現流程上評估 AI 代理的案例研究
10/7(三)Imperial Ballroom #22多元領域與新應用
PaperOrchestra:用於自動化 AI 研究論文寫作的多代理框架
10/7(三)Imperial Ballroom #23多元領域與新應用
OpenMobile:透過任務與軌跡合成建構開放式行動代理
10/7(三)Imperial Ballroom #24工具與程式
MTA-Agent:多模態深度搜尋代理的開放配方
10/7(三)Imperial Ballroom #25工具與程式
銜接資料庫與文件:混合式問答的資料—演算法協同設計
10/7(三)Imperial Ballroom #26工具與程式
DataSTORM:運用探索性資料分析與資料敘事對大規模資料庫進行深度研究
10/7(三)Imperial Ballroom #27工具與程式
CoreSemDB:針對文字豐富資料庫的混合語意—關聯式查詢處理基準測試
10/7(三)Imperial Ballroom #28評測
VeriSoftBench:針對 Lean 的儲存庫規模形式化驗證基準測試
10/7(三)Imperial Ballroom #29工具與程式
為電腦使用代理建構驗證器的藝術
10/7(三)Imperial Ballroom #30工具與程式
ComponentBench:診斷電腦使用代理的元件層級失敗
10/7(三)Imperial Ballroom #31工具與程式
CAP:針對具複雜行動與感知能力的跨網站瀏覽器代理之可擴展評估基準
10/7(三)Imperial Ballroom #32工具與程式
WebChoreArena:針對真實繁瑣網頁任務評估網頁瀏覽代理
10/7(三)Imperial Ballroom #33工具與程式
回到未來:用於試算表建立基準測試的工作簿時光機
10/7(三)Imperial Ballroom #34評測
造假的多種方式:策略導向 AI 生成下的假新聞偵測基準測試
10/7(三)Imperial Ballroom #35安全
超越困惑度(Perplexity):字元分布特徵與用於 AI 文字偵測的 MDTA 基準測試
10/7(三)Imperial Ballroom #36安全
人類與 LLM 如何從「性別中立」的外貌描述中讀出性別
10/7(三)Imperial Ballroom #37普惠 LM
從個體到互動:透過社會關係視角對多模態大型語言模型中的性別偏誤進行基準測試
10/7(三)Imperial Ballroom #38普惠 LM
LLM 反映了誰的立場?揭露並緩解知識性盲點
10/7(三)Imperial Ballroom #39普惠 LM
資源越少,分數越高:LLM 評判者中的語言偏誤
10/7(三)Imperial Ballroom #40評測
懲罰長度:揭露品質評估指標中的系統性偏誤
10/7(三)Imperial Ballroom #41評測
長度價值模型:用於 token 層級長度建模的可擴展價值預訓練
10/7(三)Imperial Ballroom #42高效運算
SCOPE:LLM 提示壓縮的生成式方法
10/7(三)Imperial Ballroom #43高效運算
光學情境壓縮只不過是(糟糕的)自編碼
10/7(三)Imperial Ballroom #44高效運算
SideQuest:針對長時間跨度代理式工作負載的模型驅動 KV 快取管理
10/7(三)Imperial Ballroom #45高效運算
Free():在僅具 Malloc 特性的推理模型中學習遺忘
10/7(三)Imperial Ballroom #46高效運算
具信心度的分岔思考(Fork-think with Confidence)
10/7(三)Imperial Ballroom #47推論演算法
推理模型中的測試時擴展,對知識密集型任務而言尚未有效
10/7(三)Imperial Ballroom #48推論演算法
取樣、對齊、合成:以 ConGrs 進行基於圖的回應合成
10/7(三)Imperial Ballroom #49推論演算法
從機制發現到提案收斂:用於科學構想的圖立基階層式搜尋
10/7(三)Imperial Ballroom #50多元領域與新應用
CrystalSTAR:用於受限新晶體發現的三重反思結構化行動協調
10/7(三)Imperial Ballroom #51多元領域與新應用
MetaSymbO:透過符號潛在演化實現多代理語言引導的超材料發現
10/7(三)Imperial Ballroom #52多元領域與新應用
AMAT:透過強化學習實現自動化多代理拓撲設計
10/7(三)Imperial Ballroom #53LM 與互動
學習遵循規範:用於訓練程序合規代理的工作流程立基環境生成
10/7(三)Imperial Ballroom #54工具與程式
RewardHarness:僅以 100 個示範學習影像編輯的人類偏好
10/7(三)Imperial Ballroom #55多模態 LM
PrefPO:成對偏好提示最佳化
10/7(三)Imperial Ballroom #56訓練
GoodPoint:從作者回應中學習具建設性的科學論文回饋
10/7(三)Imperial Ballroom #57多元領域與新應用
AI 輔助科學寫作的過程導向評估
10/7(三)Imperial Ballroom #58多元領域與新應用
當你委派任務時,LLM 會弄壞你的文件
10/7(三)Imperial Ballroom #59LM 與互動
持久狀態 AI 控制中的分散式攻擊
ORAL10/7(三)Imperial Ballroom #60安全
透過注意力集中實現偏好重定向:針對電腦使用代理的攻擊
10/7(三)Imperial Ballroom #61安全
透過情境內經驗重播與語意保留提示改寫對文字轉影像模型進行紅隊測試
10/7(三)Imperial Ballroom #62安全
FoR-SALE:基於 LLM 擴散編輯中參考框架引導的空間調整
10/7(三)Imperial Ballroom #63多模態 LM
RELISH:具潛在迭代狀態頭的 LLM 迴歸
10/7(三)Imperial Ballroom #64學習演算法
估計器的喜劇:論 LLM 強化學習訓練中的 KL 正規化
10/7(三)Imperial Ballroom #65訓練
Reinforce-Ada:非線性強化學習目標下的自適應取樣框架
10/7(三)Imperial Ballroom #66訓練
SonicSampler:用於 LLM 取樣與推測性驗證的統一分塊感知核心
10/7(三)Imperial Ballroom #67大型 LM 工程
NI Sampling++:利用強化學習最佳化 token 順序以實現快速離散擴散取樣
10/7(三)Imperial Ballroom #68推論演算法
用於擴散語言模型的遮罩感知策略梯度
10/7(三)Imperial Ballroom #69訓練
用於少步驟生成的多重遮罩擴散語言模型
10/7(三)Imperial Ballroom #70學習演算法
用於加速大型語言模型的雙串流解碼
10/7(三)Imperial Ballroom #72高效運算
用於大型有限集合受限解碼的字典樹自動機(Trie Automata)
10/7(三)Imperial Ballroom #73推論演算法
當音訊語言模型無法善用多模態情境進行構音障礙語音辨識
10/7(三)Franciscan A #74多模態 LM
MURMUR:泰米爾語與約魯巴語開放式問答的跨語言多模態檢索增強推理
10/7(三)Franciscan A #75普惠 LM
為何視覺無法作為通用橋樑:修正多語言 MLLM 中的模態異步問題
10/7(三)Franciscan A #76多模態 LM
仲裁失敗,而非知覺盲區:視覺語言模型如何解決視覺—語言衝突
10/7(三)Franciscan A #77多模態 LM
語言的代價:形心抹除揭露並利用多模態語言模型中的模態競爭
10/7(三)Franciscan A #78多模態 LM
眼見不一定為憑:揭露評估者視覺語言模型的盲點
10/7(三)Franciscan A #79多模態 LM
VLM 需要文字:視覺語言模型偏好語意錨點而忽略視覺細節
10/7(三)Franciscan A #80多模態 LM
語意豐富性還是幾何推理?VLM 視覺不變性的脆弱性
10/7(三)Franciscan B #81多模態 LM
多模態語言模型無法察覺空間不一致
10/7(三)Franciscan B #82多模態 LM
從看似合理到有憑有據:強化影片 MLLM 的結構化一致性
10/7(三)Franciscan B #83多模態 LM
TGIF:文字引導層融合可緩解多模態 LLM 的幻覺
10/7(三)Franciscan B #84多模態 LM
創造力與幻覺在 LLM 中共享機制
10/7(三)Franciscan B #85語言模型科學
在詞彙空間中解構 MLP 神經元權重
10/7(三)Franciscan B #86語言模型科學
野外的算術:Llama 使用標準加法推理循環概念
10/7(三)Franciscan B #87語言模型科學
因果吊橋:刻畫 Transformer 語言模型中句法孤島的梯度阻斷
10/7(三)Franciscan B #88心智、大腦、哲學、法律
無干擾的疊加?透過近乎正交特徵實現語言模型的孤立介入
10/7(三)Franciscan B #89語言模型科學
LangFIR:從單語資料中發掘稀疏的語言特定特徵以進行語言導引
10/7(三)Franciscan B #90語言模型科學
以人類相似性判斷評估導引技術
10/7(三)Franciscan C #91心智、大腦、哲學、法律
導引意識:從內部偵測活化導引
10/7(三)Franciscan C #92安全
在推論時導引指令階層
10/7(三)Franciscan C #93安全
Instruct-FD:你的全雙工語音系統能遵循輪替指令嗎?
10/7(三)Franciscan C #94LM 與互動
SEQUOR:貼近真實情境的多輪限制條件遵循基準測試
10/7(三)Franciscan C #95LM 與互動
COMPASS:為 LLM 代理的受限最佳化能力建立基準測試
10/7(三)Franciscan C #96工具與程式
大型語言模型在規劃問題上最佳性之分析
10/7(三)Franciscan C #97推論演算法
深度天花板:論大型語言模型在發掘潛在規劃能力上的限制
10/7(三)Franciscan C #98推論演算法
KTPO:用於長時程發現的 K 步測試時策略最佳化
10/7(三)Franciscan C #99推論演算法
ACTOR-CURATOR:透過策略改進式拉霸機演算法進行強化學習後訓練的線上課程學習
10/7(三)Franciscan C #100訓練
用於 LLM 推理的自我演化課程
10/7(三)Grand Ballroom #101訓練
新技能還是更精準的基本單元?從機率角度看 RLVR 中推理能力的湧現
10/7(三)Grand Ballroom #102語言模型科學
超越分布銳化:任務獎勵的重要性
ORAL10/7(三)Grand Ballroom #103訓練
從反彈到補救:透過表徵工程理解並緩解獎勵駭客行為
10/7(三)Grand Ballroom #104訓練
往返強化學習:為更好的化學 LLM 進行自我一致性訓練
10/7(三)Grand Ballroom #105多元領域與新應用
CONCORD:透過展開一致性對語言化 LLM 信心進行無標籤校準
10/7(三)Grand Ballroom #106語言模型科學
PAM:從政策衍生監督訓練內容審核過濾器
10/7(三)Grand Ballroom #107安全
拒絕樣本的品質至關重要:為忠實摘要建構偏好資料
10/7(三)Grand Ballroom #108資料
劇透警告:以敘事預測作為 LLM 說故事張力的評量指標
10/7(三)Grand Ballroom #109評測
從感覺到指標:理解並形式化使用者如何對 LLM 進行氛圍測試
10/7(三)Grand Ballroom #110評測
SWE-chat:來自真實使用者的野外程式撰寫代理互動紀錄
10/7(三)Grand Ballroom #111工具與程式
魔鬼藏在介面之中:評估工具架構如何形塑程式撰寫代理的行為
10/7(三)Grand Ballroom #112工具與程式
FitText:透過迷因式檢索演化代理工具生態系
10/7(三)Grand Ballroom #113工具與程式
CHASE:當排名成為唯一目標時,內容生態系如何被重塑
10/7(三)Grand Ballroom #114LM 與世界
當 RAG 未能拉平落差:上市公司事實性問答中的地域偏誤
10/7(三)Grand Ballroom #115LM 與世界
只問你所不知道的:高效多步驟 RAG 的有依據增量規劃
10/7(三)Grand Ballroom #116LM 與世界
RAQE:透過無標籤群組相對策略最佳化的重排序器對齊查詢擴展
10/7(三)Grand Ballroom #117LM 與世界
AgentIR:面向深度研究代理的推理感知檢索
10/7(三)Grand Ballroom #118工具與程式
ResearcherBench:在開放式 AI 研究任務上評估深度 AI 研究系統
10/7(三)Grand Ballroom #119評測
Sci-VBench:評估科學領域中知識與推理密集型的影片生成
10/7(三)Grand Ballroom #120多模態 LM
ScienceMeter:追蹤語言模型中的科學知識更新
10/7(三)Grand Ballroom #121LM 與世界
科學領域中 LLM 日益縮短的生命週期
10/7(三)Grand Ballroom #122多元領域與新應用
思考的隱藏代價:預訓練之外語言模型的能源使用與環境影響
10/7(三)Grand Ballroom #123大型 LM 工程
透過擴展合成巨型文件實現資料效率化的預訓練
10/7(三)Grand Ballroom #124資料
從天然資料生成預訓練 Token 以實現資料受限的擴展
10/7(三)Grand Ballroom #125資料
我們如何合成高品質的預訓練資料?提示設計、生成器模型與來源資料的系統性研究
ORAL10/7(三)Grand Ballroom #126資料
FineInstructions:將合成指令擴展至預訓練規模
10/7(三)Grand Ballroom #127資料
LM-mixup:透過以語言模型為基礎的 Mixup 進行文字資料增強
10/7(三)Grand Ballroom #128資料
抽取論證,而非只是分類:用於生成式成分偵測的指令微調 LLM
10/7(三)Grand Ballroom #129訓練
自動化還是受控?重複促發揭露基礎 LLM、指令 LLM 與人類之間的處理分歧
10/7(三)Grand Ballroom #130心智、大腦、哲學、法律
情境內範例會抑制 LLM 的科學知識回想
10/7(三)Grand Ballroom #131訓練
運用測試時運算改善潛在泛化能力
10/7(三)Grand Ballroom #132推論演算法
會思考的語言模型,聊天聊得更好
10/7(三)Grand Ballroom #133訓練
光譜上的推理:將 LLM 對齊到系統一與系統二思維
10/7(三)Grand Ballroom #134心智、大腦、哲學、法律
以 MDLM 重新思考推理:提前退出、事後推理及更多可能
10/7(三)Grand Ballroom #135學習演算法
潛在推理模型容易解釋嗎?
10/7(三)Grand Ballroom #136語言模型科學
在 Transformer 推理中為潛在演算法路由建立根基
10/7(三)Grand Ballroom #137語言模型科學
LLM 路由器:以預填活化重新思考路由
10/7(三)Grand Ballroom #138推論演算法
多樣性沒有單一最佳模型:為樣本多樣性學習一個路由器
10/7(三)Grand Ballroom #139推論演算法
路由熵:專家混合 LLM 中免費附贈的隱藏自我驗證器
10/7(三)Grand Ballroom #140學習演算法
參數高效 LLM 微調中 LoRA 混合的強化路由
10/7(三)Grand Ballroom #141高效運算
ExpertWeave:大規模高效服務專家專門化微調適配器
10/7(三)Grand Ballroom #142大型 LM 工程
讓我們逐步擴展:大規模專家混合模型的運算高效超參數轉移
10/7(三)Grand Ballroom #143大型 LM 工程
拒絕行為墜落懸崖:安全對齊在推理中如何失效?
10/8(四)Imperial Ballroom #1安全
利潤對齊問題:利潤指令如何在 LLM 中誘發對齊失敗
10/8(四)Imperial Ballroom #2安全
湧現式不忠實:對齊訓練如何使語言模型悄悄凌駕任務忠實度
10/8(四)Imperial Ballroom #3安全
透過潛在人格特質實現語言模型的高效安全對齊
10/8(四)Imperial Ballroom #4安全
在不犧牲連貫性的情況下,以活化導引實現對齊的開放式生成
10/8(四)Imperial Ballroom #5安全
從幾何到行為:指令暴露如何解鎖 LLM 中的潛在修辭方向
10/8(四)Imperial Ballroom #6語言模型科學
大型語言模型中情感表徵的潛在結構
10/8(四)Imperial Ballroom #7語言模型科學
多輪 LLM 對話中浮現的吸子狀態
10/8(四)Imperial Ballroom #8LM 與互動
STATe-of-Thoughts:用於 Tree-of-Thoughts 的結構化行動模板
10/8(四)Imperial Ballroom #9推論演算法
認知思維鏈(Cognitive Chain-of-Thought,CoCoT):針對社交情境的結構化多模態推理
10/8(四)Imperial Ballroom #10心智、大腦、哲學、法律
DeepThinkVLA:提升視覺-語言-行動模型的推理能力
10/8(四)Imperial Ballroom #11LM 與具身
解耦可指令代理的規劃與控制
10/8(四)Imperial Ballroom #12LM 與具身
從使用者互動對齊語言模型
10/8(四)Imperial Ballroom #13LM 與互動
語言模型推理的同儕預測式自我訓練
10/8(四)Imperial Ballroom #14訓練
透過強化學習實現變分共同演化
10/8(四)Imperial Ballroom #15訓練
詞彙丟棄法(Vocabulary Dropout)用於 LLM 共同演化中的課程多樣性
10/8(四)Imperial Ballroom #16訓練
論大型語言模型中的知識多樣性
10/8(四)Imperial Ballroom #17評測
CreativityNeuro:透過操縱語言模型權重提升發散思考並降低模式崩潰
10/8(四)Imperial Ballroom #18語言模型科學
Path-Lock Expert:透過架構層級分離,在混合思考模式中分離推理模式
10/8(四)Imperial Ballroom #19學習演算法
推理微調會誘發持續性的潛在策略狀態
10/8(四)Imperial Ballroom #20語言模型科學
當場逮到合理化行為:透過激活探測偵測思維鏈前後的動機性推理
10/8(四)Imperial Ballroom #21語言模型科學
連貫性的幻象:隱喻如何影響語言模型的語篇連貫性評估
ORAL10/8(四)Imperial Ballroom #22心智、大腦、哲學、法律
我們該對機器翻譯中的推理錯誤吹毛求疵嗎?
10/8(四)Imperial Ballroom #23普惠 LM
MELD:透過邏輯辯論實現的多語言集成
10/8(四)Imperial Ballroom #24普惠 LM
TowerVision:理解並改善視覺語言模型中的多語言能力
10/8(四)Imperial Ballroom #25普惠 LM
LF²AR:考量逐層動態以改善語言模型的多模態適應
10/8(四)Imperial Ballroom #26多模態 LM
DARE:擴散式大型語言模型對齊與強化執行器
10/8(四)Imperial Ballroom #27訓練
雙重溫度的故事:從擴散語言模型進行簡單、高效且多樣的取樣
10/8(四)Imperial Ballroom #28推論演算法
超越事後溫度縮放:用於 LLM 校準的雙層最佳化
10/8(四)Imperial Ballroom #29語言模型科學
過度自信且對細節視而不見:以溯因偏好學習修正提示不敏感性問題
10/8(四)Imperial Ballroom #30訓練
基於均勻資訊密度的偏好最佳化
10/8(四)Imperial Ballroom #31訓練
A11yn:針對網頁無障礙感知的使用者介面生成對齊 LLM
10/8(四)Imperial Ballroom #32工具與程式
大型視覺語言模型準備好引導視障與低視力人士了嗎?
10/8(四)Imperial Ballroom #33多模態 LM
GLAZE:用於將人類視線鎖定於網頁使用者介面的視線-語言基準測試
10/8(四)Imperial Ballroom #34多模態 LM
視覺美學基準測試:前沿模型能評斷美感嗎?
10/8(四)Imperial Ballroom #35多模態 LM
BERT-as-a-Judge:高效參考式 LLM 評估中詞彙方法的穩健替代方案
10/8(四)Imperial Ballroom #36評測
評判、檢索,或棄權:具可證明風險保證的不確定性防護 LLM 評判
10/8(四)Imperial Ballroom #37評測
評分標準作為攻擊面:LLM 評審模型中隱匿的偏好漂移
10/8(四)Imperial Ballroom #38評測
大型語言模型基於評分標準評估中的自我偏好偏誤
10/8(四)Imperial Ballroom #39評測
比較開發者與 LLM 在程式碼評估中的偏誤
10/8(四)Imperial Ballroom #40評測
追逐公開分數:程式設計代理工作流程中的使用者壓力與評估漏洞利用
10/8(四)Imperial Ballroom #41評測
代理心理計量學:代理式程式設計基準測試中的任務層級效能預測
10/8(四)Imperial Ballroom #42評測
SWE-Bench ProMax:在大規模多語言程式碼重構上對代理進行基準測試
10/8(四)Imperial Ballroom #43工具與程式
約束衰減:LLM 代理在後端程式碼生成中的脆弱性
10/8(四)Imperial Ballroom #44工具與程式
當正確的修補程式變得脆弱:對基於 LLM 的程式修復代理進行紅隊測試
10/8(四)Imperial Ballroom #45安全
CREBench:評估大型語言模型在密碼學二進位逆向工程中的表現
10/8(四)Imperial Ballroom #46安全
FinHardBench:LLM 能為金融運算生成具延遲意識的硬體嗎?
10/8(四)Imperial Ballroom #47多元領域與新應用
AutoOR:可擴展地對 LLM 進行後訓練以自動形式化作業研究問題
10/8(四)Imperial Ballroom #48多元領域與新應用
Routesplain:邁向針對軟體相關任務之忠實且可介入的路由機制
10/8(四)Imperial Ballroom #49工具與程式
SkillRouter:大規模 LLM 代理的技能路由
10/8(四)Imperial Ballroom #50工具與程式
代理式技能在真實世界中的表現如何:於真實情境中對 LLM 技能使用進行基準測試
10/8(四)Imperial Ballroom #51工具與程式
EvoSkill:多代理系統的自動化技能探索
10/8(四)Imperial Ballroom #52工具與程式
FlowEvo:透過工作流程與可執行技能的共同演化實現自我演化代理
10/8(四)Imperial Ballroom #53工具與程式
Dr. Zero:無需訓練資料的自我演化搜尋代理
10/8(四)Imperial Ballroom #54工具與程式
AERO:透過內生雙迴路回饋實現自主演化推理最佳化
10/8(四)Imperial Ballroom #55訓練
透過自主演化進行神經架構探索
10/8(四)Imperial Ballroom #56學習演算法
CORAL:邁向開放式探索的自主多代理演化
10/8(四)Imperial Ballroom #57LM 與互動
EvoX:用於自動化探索的元演化
10/8(四)Imperial Ballroom #58學習演算法
EvoLen:用於 DNA 語言模型的演化引導式分詞
10/8(四)Imperial Ballroom #59多元領域與新應用
Struc-EMB:語言嵌入中結構感知編碼的潛力
10/8(四)Imperial Ballroom #60學習演算法
崩潰之前的結構:下一個 token 預測中的暫態語意幾何
10/8(四)Imperial Ballroom #61語言模型科學
為何你的提示壓縮器刪錯了 token:一項資訊理論的診斷
10/8(四)Imperial Ballroom #62高效運算
理解 LLM 免訓練低秩壓縮中的校準與截斷誤差傳播
10/8(四)Imperial Ballroom #63高效運算
CeRA:透過在推論時保留非線性,突破低秩適應的線性天花板
10/8(四)Imperial Ballroom #64高效運算
LLM 中的超級權重與選擇性訓練的失敗
10/8(四)Imperial Ballroom #65語言模型科學
在專家混合模型微調中保留長尾專家資訊
10/8(四)Imperial Ballroom #66學習演算法
SlimQwen:探索大型 MoE 模型預訓練中的修剪與蒸餾
10/8(四)Imperial Ballroom #67高效運算
直接多 token 解碼
10/8(四)Imperial Ballroom #68高效運算
以區塊擴散草稿樹加速推測解碼
10/8(四)Imperial Ballroom #69高效運算
FlexSQL:靈活的探索與執行造就更佳的文字轉 SQL 代理
10/8(四)Imperial Ballroom #70工具與程式
BiomedSQL:針對生醫知識庫科學推理的文字轉 SQL
10/8(四)Imperial Ballroom #71多元領域與新應用
DeepScholar-Bench:用於自動化評估生成式研究綜整的即時基準測試
10/8(四)Imperial Ballroom #72評測
WebReal:針對真實世界使用者資訊需求對深度搜尋代理進行基準測試
10/8(四)Imperial Ballroom #73評測
邁向以人物誌模擬真實世界使用者、實現使用者中心功能涵蓋的全面行動應用程式測試
10/8(四)Franciscan A #74工具與程式
CocoaBench:在真實世界中評估統一數位代理
10/8(四)Franciscan A #75評測
AlphaEval:在生產環境中評估代理
10/8(四)Franciscan A #76評測
ClawsBench:在模擬工作空間中評估 LLM 生產力代理的能力與安全性
10/8(四)Franciscan A #77安全
ATBench:用於安全評估與診斷的多樣化真實代理軌跡基準測試
10/8(四)Franciscan A #78安全
PM-Bench:評估 LLM 代理的前瞻記憶
10/8(四)Franciscan A #79評測
AgentWorld:多代理 LLM 長時程協作的基準測試
10/8(四)Franciscan A #80LM 與互動
MT-PINGEVAL:以私有資訊賽局評估多輪協作
10/8(四)Franciscan B #81LM 與互動
AI 協助降低堅持度並損害獨立表現
10/8(四)Franciscan B #82LM 與互動
將 LLM 的假設語言化,以解釋並控制阿諛奉承行為
10/8(四)Franciscan B #83安全
LLM 代理能有所發現嗎?在機器學習工程任務上評估創造力
10/8(四)Franciscan B #84評測
用於訓練機器學習工程代理的合成沙盒
10/8(四)Franciscan B #85訓練
TritonRL:訓練 LLM 誠實地思考並撰寫 Triton 程式碼
10/8(四)Franciscan B #86工具與程式
Quasar:一種專為 LLM 程式碼行動設計的程式語言
10/8(四)Franciscan B #87工具與程式
MetaLint:程式碼風格檢查(linting)中從易到難的泛化能力
10/8(四)Franciscan B #88工具與程式
MAPLE:以中繼資料增強的私有語言演化
10/8(四)Franciscan B #89資料
PolicyLong:邁向同策略的情境延伸
10/8(四)Franciscan B #90資料
反思式情境學習:探討情境空間的最佳化原語
10/8(四)Franciscan C #91訓練
喚醒沉睡的代理:Lean 特定的代理資料重新啟動 Goedel Prover 中的通用工具使用能力
10/8(四)Franciscan C #92學習演算法
在自動研究代理中回收浪費的運算資源
10/8(四)Franciscan C #93高效運算
花得少、擬合得更好:透過主動實驗選擇實現預算高效的縮放律擬合
10/8(四)Franciscan C #94語言模型科學
資料受限訓練的規範性縮放律
10/8(四)Franciscan C #95語言模型科學
微調者的謬誤:何時該用你的微調資料進行預訓練
10/8(四)Franciscan C #96資料
領域感知縮放律揭示資料綜效
10/8(四)Franciscan C #97語言模型科學
透過因果表徵學習,發掘語言模型的階層式潛在能力
10/8(四)Franciscan C #98語言模型科學
語言模型是否始終如一地編碼「當前年份」?
10/8(四)Franciscan C #99語言模型科學
探討狀態空間模型中文件的「可融合性(soupability)」
10/8(四)Franciscan C #100學習演算法
訊息傳遞(Message Passing)實現高效推理
ORAL10/8(四)Grand Ballroom #101高效運算
以改裝後的遞迴機制,教導預訓練語言模型進行更深層的思考
10/8(四)Grand Ballroom #102學習演算法
解構 RoPE 的表達能力
10/8(四)Grand Ballroom #103學習演算法
向補語連詞致敬:Transformer 語言模型中句法結構的間接路由
10/8(四)Grand Ballroom #104語言模型科學
透過「恆等橋」(Identity Bridge)揭示 Transformer 中多跳推理的機制
10/8(四)Grand Ballroom #105語言模型科學
KAMR:透過知識對齊的多跳檢索,為生成內容提供依據
10/8(四)Grand Ballroom #106LM 與世界
CLaRa:以連續潛在推理銜接檢索與生成
10/8(四)Grand Ballroom #107LM 與世界
SimulRAG:以模擬器為基礎的 RAG,為長篇科學問答中的 LLM 提供依據
10/8(四)Grand Ballroom #108LM 與世界
Private-RAG:以 LLM 回答多重查詢,同時確保資料的差分隱私
10/8(四)Grand Ballroom #109安全
評估大型語言模型的檢索穩健性
10/8(四)Grand Ballroom #110評測
自我生成文本辨識:LLM 評估中的品質捷思、跨任務遷移與下游偏誤
10/8(四)Grand Ballroom #111評測
QualAlign:針對人類編碼架構,為自動化質性編碼(qualitative coding)建立基準
10/8(四)Grand Ballroom #112評測
社會情境如何形塑大型語言模型輸出中與價值觀相關的內容
10/8(四)Grand Ballroom #113心智、大腦、哲學、法律
LLM 在經濟因果推理中的意識形態偏誤
10/8(四)Grand Ballroom #114LM 與世界
虛幻真相效應,抑或僅是單純曝光效應?以 LLM 為基礎的社群媒體模擬中,因模型而異的重複效應
10/8(四)Grand Ballroom #115LM 與世界
大型語言模型中生成式廣告的誘因感知多保真度最佳化
10/8(四)Grand Ballroom #116LM 與世界
SoftmaxGRPO:運用 Softmax 優勢群組估計學習推理
10/8(四)Grand Ballroom #117訓練
從失敗中學習:以可驗證獎勵進行修正導向的策略最佳化
10/8(四)Grand Ballroom #118訓練
CURV:透過課程式視覺根據推理,強化圖表理解能力
10/8(四)Grand Ballroom #119多模態 LM
醫療視覺問答中的過度自信與校準:實證發現與幻覺感知緩解策略
10/8(四)Grand Ballroom #120多元領域與新應用
你的 logits 知道些什麼?
10/8(四)Grand Ballroom #121語言模型科學
Attr-Kit:一套高效的免解碼(No-Decode)來源歸因工具套件
10/8(四)Grand Ballroom #122語言模型科學
Pando:當模型拒絕自我解釋時,可解釋性方法是否仍然有效?
10/8(四)Grand Ballroom #123語言模型科學
當剪枝(Pruning)遇上可解釋性:在 LLM 中保留稀疏自編碼器的穩健性
10/8(四)Grand Ballroom #124語言模型科學
從保留-遺忘損失地景交互作用的視角,探討抗量化的遺忘學習
10/8(四)Grand Ballroom #125學習演算法
從開放權重語言模型中萃取(受著作權保護)書籍的記憶片段
ORAL10/8(四)Grand Ballroom #126安全
這個模型是誰打造的?透過權重空間中的頻譜指紋追溯 LLM 血統
10/8(四)Grand Ballroom #127安全
超越黑箱模糊化:白箱監控器的機制分析與防禦
10/8(四)Grand Ballroom #128安全
在大量代理軌跡中偵測安全違規行為
10/8(四)Grand Ballroom #129安全
訓練代理自我通報不當行為
10/8(四)Grand Ballroom #130安全
一次下毒,永久利用:針對網頁代理的環境注入式記憶下毒攻擊
10/8(四)Grand Ballroom #131安全
BrowseSafe:理解並偵測 AI 瀏覽器代理中的提示注入
10/8(四)Grand Ballroom #132安全
CPInj:揭露文字型協作提示最佳化中的提示注入風險
10/8(四)Grand Ballroom #133安全
延伸至現實:3D 環境中的提示注入
10/8(四)Grand Ballroom #134安全
透過語義等價的對抗性攻擊,引出 LLM 的內在幻覺
10/8(四)Grand Ballroom #135安全
當大型語言模型「認識」這張表:一套評估表格資料集中資料污染的框架
10/8(四)Grand Ballroom #136評測
TRUST:一套用於審計大型語言模型推理的群眾外包框架
10/8(四)Grand Ballroom #137評測
在真實情境下審計內容審核的穩健性
10/8(四)Grand Ballroom #138安全
回歸基本:重新審視語音代理時代的自動語音辨識
10/8(四)Grand Ballroom #139多模態 LM
SocialVeil:在溝通障礙下探測語言代理的社會智能
10/8(四)Grand Ballroom #140LM 與互動
無用但安全?在多輪對話中以使用者意圖釐清為基準,評估實用性恢復能力
10/8(四)Grand Ballroom #141安全
盲目拒絕:語言模型拒絕協助使用者規避不公、荒謬與不正當的規則
10/8(四)Grand Ballroom #142安全
當提示相互作用:評估提示算術在分布偏移下的去混淆能力
10/8(四)Grand Ballroom #143訓練
對齊打地鼠:微調會啟動大型語言模型對受著作權保護書籍的逐字回憶
ORAL10/8(四)Grand Ballroom #144安全
迷失於干擾之中:LLM 規劃代理在情境雜訊下能辨識卻無法運用相關資訊
10/8(四)Imperial Ballroom #1推論演算法
藏於稻草堆中:較小的針對 LLM 而言更難尋獲
10/8(四)Imperial Ballroom #2評測
基礎中的裂縫:看似微小的架構選擇如何影響長情境延伸
10/8(四)Imperial Ballroom #3學習演算法
Gecko:一種能內在處理任意長度序列的高效神經架構
10/8(四)Imperial Ballroom #4學習演算法
MS-GLA:透過多時間解析度,解決表徵瓶頸問題的多尺度門控線性注意力
10/8(四)Imperial Ballroom #5學習演算法
DepthSSD:透過深度軸上的狀態空間模型重新思考殘差連接
10/8(四)Imperial Ballroom #6學習演算法
MomentKV:彌合長情境推論中 KV 快取淘汰的方向性落差
10/8(四)Imperial Ballroom #7高效運算
ASPIRE:用於長上下文 LLM 推論的非同步批次自我推測解碼
10/8(四)Imperial Ballroom #8推論演算法
SPEED:用於高效推測解碼的專門位置專家
10/8(四)Imperial Ballroom #9推論演算法
Goose:用於免訓練推測解碼的非等向性推測樹
10/8(四)Imperial Ballroom #10推論演算法
大型語言模型的統計無損量化
10/8(四)Imperial Ballroom #11高效運算
NIRVANA:重新構思大型語言模型壓縮的結構化剪枝
10/8(四)Imperial Ballroom #12高效運算
OPERA:用於高效檢索模型調適的線上資料剪枝
10/8(四)Imperial Ballroom #13高效運算
透過基數限制二元二次規劃實現原則性且可擴展的多樣性感知檢索
10/8(四)Imperial Ballroom #14LM 與世界
Jagle:為視覺語言模型建構大規模日語多模態後訓練資料集
10/8(四)Imperial Ballroom #15資料
Opusanimation:基於程式碼的動態圖表生成
10/8(四)Imperial Ballroom #16多模態 LM
Co-Director:代理式生成影片敘事
10/8(四)Imperial Ballroom #17多模態 LM
透過多模態 LLM 學習人類對 AI 生成影片之「假造感」的感知
10/8(四)Imperial Ballroom #18多模態 LM
以梯度指紋偵測並抑制獎勵駭客行為
10/8(四)Imperial Ballroom #19訓練
Voice of Reason:用於口語數學的強化學習
10/8(四)Imperial Ballroom #20多模態 LM
驗證數學證明是否需要前沿模型?
10/8(四)Imperial Ballroom #21推論演算法
Ill-Defined Math:超越良定義問題的 LLM 推理基準測試
10/8(四)Imperial Ballroom #22評測
具元認知回饋的強化學習可誘發 LLM 忠實表達不確定性
10/8(四)Imperial Ballroom #23訓練
GRADE:透過梯度子空間動態探測 LLM 的知識缺口
10/8(四)Imperial Ballroom #24語言模型科學
LLM 中的文法「祖母神經元」十分罕見
10/8(四)Imperial Ballroom #25語言模型科學
詞彙嵌入在語言模型訓練早期即組織出語言結構
10/8(四)Imperial Ballroom #26語言模型科學
迷失在反向傳播中:語言模型輸出層是梯度瓶頸
10/8(四)Imperial Ballroom #27大型 LM 工程
BidirLM:透過調適與組合因果 LLM,從文字打造全模態雙向編碼器
10/8(四)Imperial Ballroom #28多模態 LM
REFRAMED:邁向電影的真實情境音訊描述生成
10/8(四)Imperial Ballroom #29多模態 LM
TIDES:用於建模多方社會動態的縱貫式雙語資料集
10/8(四)Imperial Ballroom #30LM 與互動
MoltNet:理解代理原生平台 MoltBook 中 AI 代理的社會行為
10/8(四)Imperial Ballroom #31LM 與互動
CooperBench:為何程式碼代理尚無法成為你的隊友
10/8(四)Imperial Ballroom #32LM 與互動
人格組成在何時對多代理 LLM 團隊具有影響?
10/8(四)Imperial Ballroom #33LM 與互動
高波動性與行動偏誤:群體協調中 LLM 與人類的區別
10/8(四)Imperial Ballroom #34LM 與互動
誘發情緒是否會使 LLM 在序列決策中的行為產生偏誤?
10/8(四)Imperial Ballroom #35心智、大腦、哲學、法律
AI 聊天機器人中的廣告?大型語言模型如何應對利益衝突之分析
10/8(四)Imperial Ballroom #36心智、大腦、哲學、法律
「微觀決策不是我做的」:衡量、誘發並揭露協作中目標層級的 AI 貢獻
10/8(四)Imperial Ballroom #37LM 與互動
CCBench:透過健康查詢中隱性傳達的規範評估 LLM 的文化能力
10/8(四)Imperial Ballroom #38普惠 LM
情境內行為評估:LLM 公平性評估不應仰賴標準化測驗分數
10/8(四)Imperial Ballroom #39普惠 LM
RealUserSim:透過扎根式使用者模擬彌合代理基準測試中的現實落差
10/8(四)Imperial Ballroom #40評測
ConsumerBench:終端使用者裝置上生成式 AI 應用的基準測試
10/8(四)Imperial Ballroom #41大型 LM 工程
MolDesignBench:評估基於 LLM 之代理在情境扎根式分子設計中的表現
10/8(四)Imperial Ballroom #42多元領域與新應用
RetroAgent:運用 LLM 在結構化記憶中搜尋以進行代理式逆合成規劃
10/8(四)Imperial Ballroom #43多元領域與新應用
程式碼代理能否重現計算材料科學中的研究發現?
10/8(四)Imperial Ballroom #44多元領域與新應用
Stargazer:天文物理限制條件下 AI 代理的可擴展模型擬合基準測試環境
10/8(四)Imperial Ballroom #45多元領域與新應用
Odysseys:在真實長時程任務上對網頁代理進行基準測試
10/8(四)Imperial Ballroom #46工具與程式
問題出在哪裡?以語意狀態追蹤對網頁代理進行過程層級評估
10/8(四)Imperial Ballroom #47評測
Agent Alpha:透過樹狀搜尋統一生成、探索與評估,以發掘電腦操作解法
10/8(四)Imperial Ballroom #48推論演算法
具自我反思能力的元強化學習用於代理式搜尋
10/8(四)Imperial Ballroom #49訓練
循環一致性搜尋:以問題可重建性作為搜尋代理訓練的代理獎勵
10/8(四)Imperial Ballroom #50訓練
OpenSeeker:透過完全開源訓練資料,推動前沿搜尋代理的普及化
10/8(四)Imperial Ballroom #51資料
GraphWalker:透過合成軌跡課程實現代理式知識圖譜問答
10/8(四)Imperial Ballroom #52LM 與世界
透過 BREW 改善語言代理:自舉式經驗學習環境知識
10/8(四)Imperial Ballroom #53工具與程式
TierMem:平衡壓縮記憶與原始證據,用於長時程代理記憶
10/8(四)Imperial Ballroom #54工具與程式
更簡短,但仍值得信賴?思維鏈壓縮的實證研究
10/8(四)Imperial Ballroom #55高效運算
無言之思:以抽象思維鏈實現高效潛在推理
10/8(四)Imperial Ballroom #56高效運算
碎片化思維鏈推理
10/8(四)Imperial Ballroom #57推論演算法
為何推理模型會喪失涵蓋範圍?資料與「岔路」所扮演的角色
10/8(四)Imperial Ballroom #58訓練
線上推理校準:測試時訓練實現可泛化的保形 LLM 推理
10/8(四)Imperial Ballroom #59推論演算法
被放大不代表具預測力:思考模型中的推理行為
10/8(四)Imperial Ballroom #60評測
TRAPSBench:視覺語言模型編碼了知態克制,卻無法將其表達出來
10/8(四)Imperial Ballroom #61多模態 LM
聽見卻未留意:音訊語言模型中副語言資訊的編碼與流失
10/8(四)Imperial Ballroom #62多模態 LM
OpenStamp:用於開源語言模型的浮水印
10/8(四)Imperial Ballroom #63安全
語意差異化:應對低熵限制生成輸出浮水印化的挑戰
10/8(四)Imperial Ballroom #64安全
人類與機器翻譯偵測:跨模型、跨領域與低資源分析
10/8(四)Imperial Ballroom #65普惠 LM
We Hebben Een Serieus Translatie:將互通理解建模為機率推論
10/8(四)Imperial Ballroom #66心智、大腦、哲學、法律
PromptNCE:僅使用 LLM 與對比估計提示求得條件機率與逐點互資訊
10/8(四)Imperial Ballroom #67語言模型科學
透過活化子空間理解加法的情境內學習
10/8(四)Imperial Ballroom #69語言模型科學
推理模型知道什麼重要,並將其編碼於活化值中
10/8(四)Imperial Ballroom #70語言模型科學
Transformer 拒答機制中的元件與維度稀疏性
10/8(四)Imperial Ballroom #71語言模型科學
Prism-Δ:大型語言模型提示凸顯的差異子空間導引
10/8(四)Imperial Ballroom #72推論演算法
子空間控制:將限制性模型導引轉化為可控的頻譜最佳化
10/8(四)Imperial Ballroom #73學習演算法
透過免資料共變異數估計實現模型合併
10/8(四)Franciscan A #74學習演算法
多目標演化式合併實現高效推理模型
10/8(四)Franciscan A #75高效運算
ACEvo:用於組合最佳化的問題分布與求解器對抗式共同演化
10/8(四)Franciscan A #76多元領域與新應用
透過 LLM 引導的規則合成學習可重複使用的程式轉換
10/8(四)Franciscan A #77工具與程式
模型會建模,卻不會綁定:文字轉最佳化中的結構化扎根
10/8(四)Franciscan A #78多元領域與新應用
格式稅:區分「要求結構」與「強制結構」的成本
10/8(四)Franciscan A #79推論演算法
有句法而無語意:教導 LLM 以未見過的語言撰寫程式碼
10/8(四)Franciscan A #80工具與程式
透過資訊瓶頸打破 LLM 程式碼微調中的記憶障礙以提升泛化能力
10/8(四)Franciscan B #81工具與程式
分開訓練,合併使用:採用專家混合模型的模組化後訓練
10/8(四)Franciscan B #82學習演算法
DR-LoRA:用於微調專家混合模型的動態秩 LoRA
10/8(四)Franciscan B #83訓練
MoANT:具語意感知直覺的一階秩專家混合模型,用於多任務大型語言模型微調
10/8(四)Franciscan B #84訓練
MoLGE:語言群組專家混合模型,用於大規模多語言語音辨識的高效擴展
10/8(四)Franciscan B #85普惠 LM
Marco-MoE:透過高效升級改造打造的開放式多語言專家混合語言模型
10/8(四)Franciscan B #86普惠 LM
PreMoE:面向高效專家混合模型的主動式推論
10/8(四)Franciscan B #87高效運算
路徑約束式專家混合模型
10/8(四)Franciscan B #88學習演算法
具動態運算分配與負載平衡的自迴歸語言建模專家閾值路由
10/8(四)Franciscan B #89學習演算法
專家選擇式路由實現擴散語言模型中的自適應運算
10/8(四)Franciscan B #90學習演算法
TRIMS:面向擴散語言模型的軌跡排序指令遮罩監督
10/8(四)Franciscan C #91學習演算法
透過軌跡精煉實現擴散語言模型的推論時擴展
10/8(四)Franciscan C #92推論演算法
MetaState:持久性工作記憶提升離散擴散語言模型的推理能力
10/8(四)Franciscan C #93學習演算法
CritICL:從小型語言模型失敗模式實現推論時的弱到強泛化
10/8(四)Franciscan C #94推論演算法
RefCritic:以精煉回饋訓練長思維鏈評論模型
10/8(四)Franciscan C #95訓練
Autorubric:針對不可驗證任務的基於評分標準之 LLM 評估統一框架
10/8(四)Franciscan C #96評測
利用直接偏好最佳化緩解 LLM 對虛假社會情境的偏差
10/8(四)Franciscan C #97普惠 LM
WorldPM:透過真實世界回饋擴展人類偏好建模
10/8(四)Franciscan C #98訓練
超越專家使用者:代理應協助使用者建構偏好,而非僅止於引出偏好
10/8(四)Franciscan C #99LM 與互動
將不確定性作為規劃訊號:面向目標導向對話的多輪決策制定
10/8(四)Franciscan C #100LM 與互動
LLM 在創意寫作中展現的不確定性顯著低於專業作家
10/8(四)Grand Ballroom #101語言模型科學
語言模型或許並不理解你:透過故事提示評估心智理論
10/8(四)Grand Ballroom #102心智、大腦、哲學、法律
深入學生的思維:在 LLM 學生模擬器中聯合建模潛在推理與行動
10/8(四)Grand Ballroom #103多元領域與新應用
HPFA:面向 LLM 推理的基於超圖之成對失敗歸因
10/8(四)Grand Ballroom #104推論演算法
是誰弄壞了系統?基於 LLM 的多代理系統中的失敗定位
10/8(四)Grand Ballroom #105LM 與互動
Agent Q-Mix:透過強化學習為 LLM 多代理系統選擇正確行動
10/8(四)Grand Ballroom #106LM 與互動
透過輪次層級重要性取樣與裁剪觸發正規化,穩定長期 LLM 代理的離策略訓練
10/8(四)Grand Ballroom #107訓練
邁向 LLM 的全流程 FP8 強化學習
10/8(四)Grand Ballroom #108高效運算
透過拉格朗日獎勵增強實現安全的推論時對齊
10/8(四)Grand Ballroom #109安全
RL-VLA^3:面向視覺-語言-行動(VLA)訓練的靈活非同步強化學習框架
10/8(四)Grand Ballroom #110LM 與具身
隨推理展開而學習:面向高效強化學習的漸進式 Rollout 分配
10/8(四)Grand Ballroom #111訓練
ExpRL:面向 LLM 中期訓練的探索式強化學習
10/8(四)Grand Ballroom #112訓練
多樣性還是精確度?深入探討下一個 token 預測
ORAL10/8(四)Grand Ballroom #113語言模型科學
Se-DPO:面向直接偏好最佳化的自我演化 Token 信用度
10/8(四)Grand Ballroom #114訓練
Token 層級控制,還是僅僅是更好的平均值?區隔自適應解碼的效益來源
10/8(四)Grand Ballroom #115推論演算法
無權重微調:透過 Logit 空間傳輸實現 LLM 個人化
10/8(四)Grand Ballroom #116LM 與互動
課程學習即傳輸:透過 Wasserstein 測地線理解課程設計
10/8(四)Grand Ballroom #117訓練
透過模態連通性視角理解機器遺忘學習
10/8(四)Grand Ballroom #118學習演算法
論機器遺忘學習中「重訓等價性」的不可能性
10/8(四)Grand Ballroom #119學習演算法
LACUNA:評估 LLM 遺忘學習定位精確度的測試平台
10/8(四)Grand Ballroom #120學習演算法
MoRFI:單調稀疏自編碼器特徵識別
10/8(四)Grand Ballroom #122語言模型科學
UNMASK:發現並因果驗證文本分類器中的虛假捷徑
10/8(四)Grand Ballroom #123語言模型科學
基準測試設計者應「在測試集上訓練」,以揭露可被利用的非視覺捷徑
10/8(四)Grand Ballroom #124評測
TemMed-Bench:評估視覺-語言模型中的時序醫學影像推理能力
10/8(四)Grand Ballroom #125多元領域與新應用
CARV:多模態 LLM 組合式類比推理的診斷性基準測試
10/8(四)Grand Ballroom #126多模態 LM
Percept-V 挑戰:多模態 LLM 能破解簡單的知覺問題嗎?
10/8(四)Grand Ballroom #127多模態 LM
Pixel-SAIL:用於像素級基礎理解的單一 Transformer
10/8(四)Grand Ballroom #128多模態 LM
CoVLA:以更少視覺 Token 實現視覺-語言對齊
10/8(四)Grand Ballroom #129多模態 LM
EvoSelect:面向目標任務適配的資料高效 LLM 演化
10/8(四)Grand Ballroom #130資料
教導 LLM 自我演化:以強化學習培養核心後設技能
10/8(四)Grand Ballroom #131訓練
EvoSkillBank:面向代理持續學習的階層式技能自我演化與技能庫治理
10/8(四)Grand Ballroom #132學習演算法
邁向透過技能圖實現可擴展的終端任務合成
10/8(四)Grand Ballroom #133工具與程式
預算感知工具使用實現有效的代理擴展
10/8(四)Grand Ballroom #134工具與程式
面向推理的思維層級集束搜尋
10/8(四)Grand Ballroom #135高效運算
TRACES:標記推理步驟以實現自適應、具成本效益的提前停止
10/8(四)Grand Ballroom #136高效運算
HarmThoughts:推理軌跡中細粒度有害行為偵測基準測試
10/8(四)Grand Ballroom #137安全
TrailBlazer:歷史引導的強化學習用於黑箱 LLM 越獄
10/8(四)Grand Ballroom #138安全
有本事就攻破我:透過詞彙插入提示對已對齊 LLM 進行自我越獄
10/8(四)Grand Ballroom #139安全
PISmith:基於強化學習的紅隊測試,用於評估提示注入防禦
10/8(四)Grand Ballroom #140安全
對抗間接提示注入的改善穩健性可內建於 LLM 之中
10/8(四)Grand Ballroom #141安全
針對大型推理模型的干擾項注入攻擊:特性刻劃與防禦
10/8(四)Grand Ballroom #142安全
MEMENTO:教導 LLM 管理自身的情境脈絡
ORAL10/8(四)Grand Ballroom #143高效運算
AI 基準測試究竟在衡量什麼:運用聚合效度與區辨效度檢視 56 個 AI 基準測試
ORAL10/8(四)Grand Ballroom #144評測
內省式擴散語言模型
ORAL10/8(四)Grand Ballroom #145學習演算法