COLM 2026
translate EN

接受論文

上方篩選、左側選論文、右側閱讀。房間顏色與議程頁一致。複製網址即可分享篩選結果或單篇論文。

856 / 856 篇
日期
場次
地點
類型
主題
  • 多模態模型中的不對稱特異性

    10/6(二)Imperial Ballroom #1多模態 LM
  • 視覺語言模型中的來源模態監控

    ORAL10/6(二)Imperial Ballroom #2多模態 LM
  • 當「看見」凌駕「知道」:視覺語言模型中個人化安全的視覺主導性與延遲判斷法

    10/6(二)Imperial Ballroom #3安全
  • V-DEAL:將影片安全失準診斷為「理解—拒絕」耦合失敗

    10/6(二)Imperial Ballroom #4安全
  • 小心你所自動完成的:後門程式碼補全的鑑識溯源

    10/6(二)Imperial Ballroom #5安全
  • 現行大多數「模型生物」都會洩漏資訊:困惑度差異法經常能揭露微調目標

    10/6(二)Imperial Ballroom #6安全
  • 對齊中的盲點:量化大型語言模型的生物安全風險

    10/6(二)Imperial Ballroom #7安全
  • Self-Correction Bench:揭露並解決大型語言模型中的自我修正盲點

    10/6(二)Imperial Ballroom #8推論演算法
  • 壓力下的脆弱性:評估 LLM 在受限互動式程式設計中的迭代穩定性

    10/6(二)Imperial Ballroom #9評測
  • LPDS:透過保持邏輯不變的難度縮放評估 LLM 穩健性

    10/6(二)Imperial Ballroom #10評測
  • LLM 對於作業研究是否夠穩健?透過 AttackOR 進行的對抗攻擊與防禦研究

    10/6(二)Imperial Ballroom #11安全
  • ConformalGuard:語言模型分類器的假陽性可控行動閘控

    10/6(二)Imperial Ballroom #12評測
  • BAS:以決策理論方法評估大型語言模型的信心程度

    10/6(二)Imperial Ballroom #13評測
  • Pinocchio:黑箱語言模型的快速不確定性估計

    10/6(二)Imperial Ballroom #14評測
  • FERA:大型語言模型的不確定性感知聯邦推理

    10/6(二)Imperial Ballroom #15學習演算法
  • KoSimpleQA:韓語事實性基準測試與推理型 LLM 分析

    10/6(二)Imperial Ballroom #16普惠 LM
  • 透過社會元學習學習如何從語言回饋中學習

    10/6(二)Imperial Ballroom #17LM 與互動
  • 情境內探索與利用之取捨受語意先驗偏誤影響

    10/6(二)Imperial Ballroom #18心智、大腦、哲學、法律
  • ContextBudget:面向長視野搜尋代理的預算感知情境管理

    10/6(二)Imperial Ballroom #19工具與程式
  • 潛在情境編譯:將長情境萃取為緊湊可攜式記憶

    10/6(二)Imperial Ballroom #20高效運算
  • 自我剪枝 Transformer:以通用注意力機制實現極致 KV 快取壓縮

    10/6(二)Imperial Ballroom #21高效運算
  • HISA:用於細粒度稀疏注意力的高效階層式索引

    10/6(二)Imperial Ballroom #22高效運算
  • 凝視注意力:面向高效多模態 LLM 的查詢自適應視覺路由

    10/6(二)Imperial Ballroom #23高效運算
  • 從估計的聆聽者凝視中學習指稱表達

    10/6(二)Imperial Ballroom #24多模態 LM
  • 以顯式的位置到座標映射改善 GUI 定位

    10/6(二)Imperial Ballroom #25工具與程式
  • v1:學習指向視覺 token 以實現多模態數學紮根推理

    10/6(二)Imperial Ballroom #26多模態 LM
  • 看見未見之物:Transformer 在符號推理中的泛化能力

    10/6(二)Imperial Ballroom #27語言模型科學
  • 以思考換取回想:推理如何解鎖 LLM 中的參數化知識

    10/6(二)Imperial Ballroom #28LM 與世界
  • 多語言 LLM 中對非參數化記憶的推理:關係知識的認知基礎分析

    10/6(二)Imperial Ballroom #29普惠 LM
  • 揭露支持大型語言模型中類人概念表徵的計算成分

    10/6(二)Imperial Ballroom #30心智、大腦、哲學、法律
  • 大型語言模型在創意思考期間與人腦活動對齊

    10/6(二)Imperial Ballroom #31心智、大腦、哲學、法律
  • CreativityBench:透過基於可供性的工具再利用評估創意推理

    10/6(二)Imperial Ballroom #32評測
  • 工具的幻象:重新思考網頁代理中的工具使用

    10/6(二)Imperial Ballroom #33工具與程式
  • CollabSkill:評估真實世界任務中的人機協作

    ORAL10/6(二)Imperial Ballroom #34LM 與互動
  • SkillLearnBench:為真實世界任務中的代理技能生成,對持續學習方法進行基準測試

    10/6(二)Imperial Ballroom #35學習演算法
  • 刻劃模型原生技能

    10/6(二)Imperial Ballroom #36語言模型科學
  • 語言模型中的能力溯源:一項社會推理的案例研究

    10/6(二)Imperial Ballroom #37資料
  • 原型語言模型

    10/6(二)Imperial Ballroom #38語言模型科學
  • 分布偏移下用於忠實生成的 token 層級離策略學習

    10/6(二)Imperial Ballroom #39訓練
  • 解密 OPD:大型語言模型的長度膨脹與穩定化策略

    10/6(二)Imperial Ballroom #40訓練
  • 功能先於形式:具備副本專家機制的專家混合模型中的分布正交化

    10/6(二)Imperial Ballroom #41學習演算法
  • MoRE:重複使用專家的混合模型

    10/6(二)Imperial Ballroom #42學習演算法
  • 深度漸增模型能否克服深度詛咒?一項深入分析

    10/6(二)Imperial Ballroom #43學習演算法
  • Parcae:穩定循環語言模型的縮放定律

    10/6(二)Imperial Ballroom #44語言模型科學
  • 大型語言模型訓練動態背後的頻譜傳輸機制

    10/6(二)Imperial Ballroom #45語言模型科學
  • MegaTrain:在單一 GPU 上以全精度訓練超過 1000 億參數的大型語言模型

    10/6(二)Imperial Ballroom #46大型 LM 工程
  • KronQ:透過 Kronecker 分解 Hessian 進行的 LLM 量化

    10/6(二)Imperial Ballroom #47高效運算
  • 用於二次規劃與決策制定的共變異數感知 Transformer

    10/6(二)Imperial Ballroom #48多元領域與新應用
  • Squeeze Evolve:用於無驗證器演化的統一多模型編排框架

    10/6(二)Imperial Ballroom #49大型 LM 工程
  • DreamProver:透過清醒—睡眠定理證明代理演化可遷移的引理庫

    10/6(二)Imperial Ballroom #50推論演算法
  • Goedel-Code-Prover:面向開放最先進程式碼驗證的階層式證明搜尋

    10/6(二)Imperial Ballroom #51推論演算法
  • Intern-S1-MO:面向奧林匹亞級數學解題的長視野推理代理

    10/6(二)Imperial Ballroom #52訓練
  • 面向工具增強型大型語言模型的程序感知強化學習

    10/6(二)Imperial Ballroom #53訓練
  • CuSearch:透過搜尋深度實現代理式 RAG 的課程式推演取樣

    10/6(二)Imperial Ballroom #54訓練
  • Struct-Searcher:代理式結構化思考推進多模態深度資訊探尋

    10/6(二)Imperial Ballroom #55工具與程式
  • 澄清或回答:面向情境規格不明代理式視覺問答的強化學習

    10/6(二)Imperial Ballroom #56多模態 LM
  • 針對模糊請求的意圖推理

    ORAL10/6(二)Imperial Ballroom #57LM 與互動
  • 先知後答:解讀語言模型以實現可靠的 RAG

    10/6(二)Imperial Ballroom #58LM 與世界
  • 修訂還是重新求解?拆解多 LLM 流程中第二輪的收益來源

    10/6(二)Imperial Ballroom #59推論演算法
  • RationalRewards:推理獎勵同時擴展視覺生成的訓練與測試階段

    10/6(二)Imperial Ballroom #60多模態 LM
  • Personalized RewardBench:以符合人類的個人化評估獎勵模型

    10/6(二)Imperial Ballroom #61評測
  • LLM 能辨識你的潛在偏好嗎?個人化互動中潛在資訊發現的基準測試

    10/6(二)Imperial Ballroom #62LM 與互動
  • PreScam:從早期對話預測詐騙進程的基準測試

    10/6(二)Imperial Ballroom #63安全
  • 留意代理式任務使用者模擬中的模擬到真實落差

    10/6(二)Imperial Ballroom #64評測
  • InterviewSim:一套以訪談為紮根的人格模擬可擴展框架

    10/6(二)Imperial Ballroom #65LM 與世界
  • 從內部辨識內省

    10/6(二)Imperial Ballroom #66心智、大腦、哲學、法律
  • 規則對比後果:LLM 中道德推理的可分離內部表徵

    10/6(二)Imperial Ballroom #67心智、大腦、哲學、法律
  • 互動協定形塑多代理辯論中的道德判斷

    10/6(二)Imperial Ballroom #68LM 與互動
  • 失準的傳染:失準少數能否在多代理 LLM 審議中撼動對齊的多數?

    10/6(二)Imperial Ballroom #69安全
  • 深度研究代理帶來更深層的危害

    10/6(二)Imperial Ballroom #70安全
  • 不受歡迎的人設:單一方法的安全評估對賦予人設的 LLM 而言並不完整

    10/6(二)Imperial Ballroom #71安全
  • 隱藏的操偶師:預測操縱性 LLM 對話中的人類信念變化

    10/6(二)Imperial Ballroom #72LM 與互動
  • 將自己訓練成一個 LLM:透過角色扮演式 LLM 訓練探索 AI 素養對說服力的影響

    10/6(二)Imperial Ballroom #73LM 與互動
  • 自主性如何重塑個人化對 LLM 代理隱私疑慮與信任的影響

    10/6(二)Franciscan A #74LM 與互動
  • 將計就計:透過心智理論學習用於信念操控的雙面間諜防禦者

    10/6(二)Franciscan A #75安全
  • 源自敘事小說的情境化規範擬像

    10/6(二)Franciscan A #76安全
  • LLM 內部是否知道什麼是隱私?探測並操控大型語言模型表徵中的情境隱私規範

    10/6(二)Franciscan A #77安全
  • 潛意識操控:隱藏訊號的編碼與偵測

    10/6(二)Franciscan A #78安全
  • 流形操控揭示神經網路表徵與行為的共享幾何結構

    10/6(二)Franciscan A #79語言模型科學
  • 透過生成式因果中介進行激活操控

    10/6(二)Franciscan A #80語言模型科學
  • 操控 LLM 以生成具文化在地化的內容

    10/6(二)Franciscan B #81普惠 LM
  • MET:立基於理論且具文化意識的多語言道德推理

    10/6(二)Franciscan B #82普惠 LM
  • 評估並緩解英語至印地語機器翻譯中的性別誤植問題

    10/6(二)Franciscan B #83普惠 LM
  • MMMG:一個全面且可靠的多任務多模態生成基準測試

    10/6(二)Franciscan B #84多模態 LM
  • SynthDocBench:用於長情境視覺文件理解的受控基準測試

    10/6(二)Franciscan B #85多模態 LM
  • Oolong:評估長情境推理與聚合能力

    10/6(二)Franciscan B #86評測
  • Valley3:為電子商務擴展全模態基礎模型

    10/6(二)Franciscan B #87多元領域與新應用
  • TSRouter:用於時間序列推理的動態模態—模型選擇

    10/6(二)Franciscan B #88多模態 LM
  • FlexRouter:學習互補模型集合以實現彈性 LLM 路由

    10/6(二)Franciscan B #89高效運算
  • FLINT:透過曲率感知資料選擇與微調,為 LoRA 建立影響力引導的主動學習框架

    10/6(二)Franciscan B #90資料
  • 邁向用於語言模型微調的主動合成資料生成

    10/6(二)Franciscan C #91資料
  • 適用於任意可微分目標的合成資料

    10/6(二)Franciscan C #92資料
  • 以對比解碼合成指令微調資料集

    10/6(二)Franciscan C #93資料
  • 從術語到圖表:用於科學圖表理解的視覺指令生成

    10/6(二)Franciscan C #94多模態 LM
  • All-Weather VLM:提升視覺語言模型在惡劣成像條件下的穩健性

    10/6(二)Franciscan C #95多模態 LM
  • 用於抑制 VLM 幻覺的維納濾波法

    10/6(二)Franciscan C #96多模態 LM
  • 為何微調會助長幻覺,以及如何修正

    10/6(二)Franciscan C #97訓練
  • 微調並非失效而是過於分散:透過投影誤差訊號實現精確知識編輯

    10/6(二)Franciscan C #98訓練
  • LLM 的知識十分脆弱:真實性表徵仰賴表面相似性

    10/6(二)Franciscan C #99LM 與世界
  • 當驗證失效時:組合式不可行主張如何逃過拒絕

    10/6(二)Franciscan C #100LM 與世界
  • ReFIne:兼具可靠性、忠實性與可解釋性的可信賴大型推理模型框架

    10/6(二)Grand Ballroom #101推論演算法
  • 過濾式推理分數:以模型最具信心的推理軌跡評估推理品質

    10/6(二)Grand Ballroom #102評測
  • 理解並緩解過早自信,以提升 LLM 推理表現

    10/6(二)Grand Ballroom #103推論演算法
  • 反事實模擬訓練用於提升鏈式思考的忠實性

    10/6(二)Grand Ballroom #104語言模型科學
  • 在長鏈思考監督式微調中,資料重複優於資料擴增

    10/6(二)Grand Ballroom #105資料
  • 早期資料曝露可提升對後續微調的穩健性

    10/6(二)Grand Ballroom #106資料
  • PivotRL:以低運算成本實現高準確率的代理式訓練後調整

    10/6(二)Grand Ballroom #107訓練
  • V_{0.5}:以通用型價值模型作為稀疏強化學習展開的先驗

    10/6(二)Grand Ballroom #108訓練
  • HeaPA:用於 LLM 強化學習的難度感知堆積採樣與同策略查詢擴增

    10/6(二)Grand Ballroom #109訓練
  • 對抗式獎勵稽核:主動偵測並緩解獎勵駭客行為

    10/6(二)Grand Ballroom #110訓練
  • 行為金絲雀:稽核強化學習微調中私有檢索情境的使用情況

    10/6(二)Grand Ballroom #111安全
  • 用於稽核 LLM 評判者行為依存性與誘發偏誤的統計框架

    10/6(二)Grand Ballroom #112評測
  • FLY-EVAL++:用於具身系統中安全約束建模的循證式評估

    10/6(二)Grand Ballroom #113LM 與具身
  • 衡量可靠性的「九」數:飽和 GSM 基準測試中的樣本高效 LLM 評估

    10/6(二)Grand Ballroom #114評測
  • LLM 中的隨機性錯覺

    10/6(二)Grand Ballroom #115推論演算法
  • 為何高斯擴散模型在離散資料上會失效?

    10/6(二)Grand Ballroom #116學習演算法
  • 衡量文字中的 AI「劣質內容」(slop)

    10/6(二)Grand Ballroom #117評測
  • 讓網格集束搜尋(Grid Beam Search)不再那麼貪婪

    10/6(二)Grand Ballroom #118推論演算法
  • 只編碼一次,從不解碼:重用音訊語言模型內部表徵以實現高效時間定位

    10/6(二)Grand Ballroom #119高效運算
  • 不僅止於詞彙:用於高效語言模型的組合式分詞法

    ORAL10/6(二)Grand Ballroom #120高效運算
  • LLM 集成的推論擴展:以 Token 轉譯橋接不同的 Token 空間

    10/6(二)Grand Ballroom #121推論演算法
  • Tiny Aya:銜接規模與多語言深度

    10/6(二)Grand Ballroom #122普惠 LM
  • MameLoshnLM:意第緒語語言模型與評估基準測試

    10/6(二)Grand Ballroom #123普惠 LM
  • 嵌入模型的兩難:LLM 表現更好,但代價是什麼?

    10/6(二)Grand Ballroom #124高效運算
  • LLM 會編碼自身的失敗:從生成前的激活值預測成功機率

    10/6(二)Grand Ballroom #125推論演算法
  • 為代理式程式撰寫擴展測試階段運算量

    10/6(二)Grand Ballroom #126推論演算法
  • SWE-Replay:軟體工程代理的高效測試階段擴展

    10/6(二)Grand Ballroom #127工具與程式
  • 為平行程式碼學習推理式世界模型

    10/6(二)Grand Ballroom #128工具與程式
  • SuperCoder:運用大型語言模型進行組合語言程式超最佳化

    10/6(二)Grand Ballroom #129工具與程式
  • DarwinLM:大型語言模型的演化式結構化剪枝

    10/6(二)Grand Ballroom #130高效運算
  • Sememe:大型語言模型任務感知深度剪枝的因果建模

    10/6(二)Grand Ballroom #131高效運算
  • SEER:透過選擇性視覺—文字壓縮實現長情境推理

    10/6(二)Grand Ballroom #132高效運算
  • Resa:透過稀疏自編碼器實現高效推理模型

    10/6(二)Grand Ballroom #133高效運算
  • π²:源於結構的推理資料提升大型語言模型的長情境推理能力

    10/6(二)Grand Ballroom #134資料
  • LakeQuest:跨資料湖的根植式問答三領域基準測試

    10/6(二)Grand Ballroom #135多模態 LM
  • OfficeQA Pro:端到端根植式推理的企業級基準測試

    10/6(二)Grand Ballroom #136工具與程式
  • 在語言模型中共同演化結構化知識與推理

    10/6(二)Grand Ballroom #137LM 與世界
  • SAKE:透過強化學習實現複雜 LLM 推理的結構化代理式知識外推

    10/6(二)Grand Ballroom #138工具與程式
  • CABLE:透過互補式前因連結與擴展延伸記憶檢索的觸及範圍

    10/6(二)Grand Ballroom #139工具與程式
  • RecaLLM:以明確的情境內檢索處理「迷失於思考中」現象

    10/6(二)Grand Ballroom #140LM 與世界
  • 無法遺忘:主動干擾揭示 LLM 工作記憶超越情境長度的限制

    10/6(二)Grand Ballroom #141心智、大腦、哲學、法律
  • 情節記憶是否有助於縮小句法對比敏感度中的詞彙頻率落差?一項運用檢索增強語言模型的測試

    10/6(二)Grand Ballroom #142心智、大腦、哲學、法律
  • Combee:為自我改進的 LLM 代理擴展平行提示學習

    10/6(二)Imperial Ballroom #1訓練
  • 訓練具主動性與個人化的 LLM 代理

    10/6(二)Imperial Ballroom #2LM 與互動
  • 真實與模擬人類群體中的身分認同、合作與框架效應

    10/6(二)Imperial Ballroom #3LM 與世界
  • 模擬組織化群體行為:新框架、基準測試與分析

    10/6(二)Imperial Ballroom #4LM 與世界
  • 人類認知與行為的小型基礎模型

    10/6(二)Imperial Ballroom #5心智、大腦、哲學、法律
  • LLM 決策中的表層信念

    10/6(二)Imperial Ballroom #6心智、大腦、哲學、法律
  • LLM 何時會承認錯誤?理解模型信念在撤回中的角色

    ORAL10/6(二)Imperial Ballroom #8心智、大腦、哲學、法律
  • 何時該說蘋果是紅色的:人類遵循內省規則,VLM 則不然

    10/6(二)Imperial Ballroom #9心智、大腦、哲學、法律
  • 天生過度自信:LLM 中言語化信心膨脹的機制觀點

    10/6(二)Imperial Ballroom #10語言模型科學
  • 跨模型電路遷移的可微分保真度對齊

    10/6(二)Imperial Ballroom #11語言模型科學
  • ADAG:自動描述歸因圖

    10/6(二)Imperial Ballroom #12語言模型科學
  • Data Canvas:代理式資料工程的來源導向框架

    10/6(二)Imperial Ballroom #13工具與程式
  • 最佳化器即代理:跨提示、程式與機器學習工作流程的推理驅動搜尋

    10/6(二)Imperial Ballroom #14工具與程式
  • 遞迴代理最佳化

    10/6(二)Imperial Ballroom #15訓練
  • Agent0:透過工具整合推理,從零資料釋放自我演化代理

    10/6(二)Imperial Ballroom #16工具與程式
  • SkillFoundry:從異質科學資源建構自我演化代理技能庫

    10/6(二)Imperial Ballroom #17工具與程式
  • SkillFlow:可擴展且高效的代理技能檢索系統

    10/6(二)Imperial Ballroom #18工具與程式
  • CoSearch:透過強化學習聯合訓練代理式搜尋的推理與文件排序

    10/6(二)Imperial Ballroom #19工具與程式
  • 迷失在迷宮中:克服長時程代理式搜尋的上下文限制

    10/6(二)Imperial Ballroom #20工具與程式
  • 別失去頭緒:以認知資源自我分配賦能長時程 LLM 代理

    10/6(二)Imperial Ballroom #21工具與程式
  • AdaPlanBench:在世界與使用者限制下評估大型語言模型代理的自適應規劃

    10/6(二)Imperial Ballroom #22推論演算法
  • SIMMER:以世界模型為 LLM 可執行規劃中的潛在失敗建立基準

    10/6(二)Imperial Ballroom #23推論演算法
  • 透過型別化失敗標記進行失敗感知滲透測試:從校準預測到結構化復原

    10/6(二)Imperial Ballroom #24安全
  • 用於資料代理改進的診斷性失敗分類法與軌跡評判器

    10/6(二)Imperial Ballroom #25工具與程式
  • MedAction:邁向主動式多輪臨床診斷 LLM

    10/6(二)Imperial Ballroom #26多元領域與新應用
  • MedConceal:部分可觀測性下臨床隱性顧慮推理的基準測試

    10/6(二)Imperial Ballroom #27多元領域與新應用
  • JMedEthicBench:日語醫學倫理對齊的多輪對抗式基準測試

    10/6(二)Imperial Ballroom #28多元領域與新應用
  • TRIDENT:金融、醫學與法律領域 LLM 安全性基準測試

    10/6(二)Imperial Ballroom #29安全
  • LLM 也會「腦腐」:一項針對 Twitter/X 的先導研究

    10/6(二)Imperial Ballroom #30資料
  • 我們能信任憶阻器上的 LLM 嗎?深入探討非理想條件下的推理能力

    10/6(二)Imperial Ballroom #31大型 LM 工程
  • 上下文中的疊加現象:大型語言模型中類人的工作記憶干擾

    10/6(二)Imperial Ballroom #32心智、大腦、哲學、法律
  • 疊加的幻象?語言模型中潛在思考的原理性分析

    10/6(二)Imperial Ballroom #33語言模型科學
  • 稀疏自編碼器能捕捉概念流形嗎?

    10/6(二)Imperial Ballroom #34語言模型科學
  • 大型語言模型中特徵空間的語意結構

    10/6(二)Imperial Ballroom #35語言模型科學
  • LLM2Vec-Gen:來自大型語言模型的生成式嵌入

    10/6(二)Imperial Ballroom #36學習演算法
  • SMETA-ZSL:用於零樣本威脅分類的語意元對齊

    10/6(二)Imperial Ballroom #37安全
  • GRIP:透過幾何路由限制實現與演算法無關的混合專家機器遺忘

    10/6(二)Imperial Ballroom #38學習演算法
  • 遺忘去遺忘:注意力匯聚點作為 LLM 遺忘後門攻擊的入口

    10/6(二)Imperial Ballroom #39安全
  • ContextLeak:稽核私有上下文學習方法中的洩漏

    10/6(二)Imperial Ballroom #40安全
  • LLM 中免訓練與基於訓練的意圖分類:準確性、穩健性與失敗模式

    10/6(二)Imperial Ballroom #41評測
  • GLiGuard:LLM 防護的基模式條件式分類

    10/6(二)Imperial Ballroom #42安全
  • Guard Vector:透過任務向量組合與串流感知前綴 SFT 超越英語 LLM 護欄

    10/6(二)Imperial Ballroom #43安全
  • 強大卻脆弱:簡單攻擊即可攻破基於推理的安全護欄

    10/6(二)Imperial Ballroom #44安全
  • 理解安全去對齊對大型語言模型的影響

    10/6(二)Imperial Ballroom #45安全
  • 逃離納許陷阱:大型語言模型中策略推理的結構性估計與對齊

    10/6(二)Imperial Ballroom #46LM 與世界
  • 透過與人類群體對齊,使多重生成式代理更多樣化

    10/6(二)Imperial Ballroom #47普惠 LM
  • 大型語言模型能在教育內容生成上匹敵人類多樣性嗎?

    10/6(二)Imperial Ballroom #48LM 與世界
  • 分岔提示的花園:使用者如何在故事生成中探索敘事空間

    10/6(二)Imperial Ballroom #49LM 與互動
  • 代理即評判者的多語言提示在地化:需求層級評估中的語言與骨幹模型敏感度

    10/6(二)Imperial Ballroom #50普惠 LM
  • 行動勝於言語:衡量使用工具代理中的跨語言政策保留度

    10/6(二)Imperial Ballroom #51普惠 LM
  • 多語言嵌入探針無法跨學習者語料庫泛化

    10/6(二)Imperial Ballroom #52普惠 LM
  • 迷失於巴別塔:LLM 中偶然性多語言的不良影響

    10/6(二)Imperial Ballroom #53普惠 LM
  • 英語並非唯一所需:系統性探討多語言性在 LLM 後訓練中的角色

    10/6(二)Imperial Ballroom #54普惠 LM
  • MaLA:用於大型語言模型大規模語言調適的語料庫與資料混合

    10/6(二)Imperial Ballroom #55普惠 LM
  • 以封面評斷一本書:探討多模態 LLM 在多頁手寫文件轉錄上的應用

    10/6(二)Imperial Ballroom #56多模態 LM
  • ComDoc:文件檢索增強生成的綜合基準測試

    10/6(二)Imperial Ballroom #57LM 與世界
  • 透過查詢涵蓋率與陳述可驗證性邁向與查詢無關的 RAG 評估

    10/6(二)Imperial Ballroom #58LM 與世界
  • OSCAR:協同自我驗證與跨路徑精修

    10/6(二)Imperial Ballroom #59LM 與世界
  • SALA:用於開放式文本生成的語法感知 Logit 調整

    10/6(二)Imperial Ballroom #60推論演算法
  • 關係子句依附於何處?探討大型音訊語言模型的韻律與語意敏感度

    10/6(二)Imperial Ballroom #61心智、大腦、哲學、法律
  • 共享語法的共享電路:追蹤跨語言的主詞—動詞一致性

    10/6(二)Imperial Ballroom #62語言模型科學
  • 漸進式語碼轉換作為 LLM 推論時跨語言表徵對齊的方法

    10/6(二)Imperial Ballroom #63普惠 LM
  • Verb-ICL:重新思考結構化預測的上下文學習

    10/6(二)Imperial Ballroom #64訓練
  • RIMS:透過平滑多配對聚合進行偏好最佳化,適用於小規模 LLM 檢索增強生成

    10/6(二)Imperial Ballroom #65訓練
  • 用於裝置端檢索增強生成的統一模型與文件表徵

    10/6(二)Imperial Ballroom #66LM 與世界
  • 回歸基礎:讓對話代理僅憑檢索與生成即可記憶

    10/6(二)Imperial Ballroom #67LM 與世界
  • 是什麼讓檢索在教學對話標註上發揮作用?索引粒度勝於檢索器調適

    10/6(二)Imperial Ballroom #68LM 與世界
  • KT4EQG:透過知識追蹤生成個人化練習題

    10/6(二)Imperial Ballroom #69LM 與世界
  • SERUM:用於使用者建模的狀態擷取與精修

    10/6(二)Imperial Ballroom #70多模態 LM
  • EgoMemReason:長時程第一人稱視訊理解的記憶驅動推理基準測試

    10/6(二)Imperial Ballroom #71多模態 LM
  • MMEB-V3:衡量全模態嵌入模型的效能落差

    10/6(二)Imperial Ballroom #72多模態 LM
  • 可解釋 AI 生成影像偵測獎勵基準測試

    10/6(二)Imperial Ballroom #73安全
  • 以影像生成進行推理

    10/6(二)Franciscan A #74多模態 LM
  • FronTalk:以多模態回饋將前端開發基準化為對話式程式碼生成

    10/6(二)Franciscan A #75工具與程式
  • 空談容易,溝通困難:多代理協商中的動態基礎建立失敗與修復

    10/6(二)Franciscan A #76LM 與互動
  • 非同步軟體工程代理的有效策略

    10/6(二)Franciscan A #77工具與程式
  • HAI-Agent:透過交接介入改善長時程軟體工程

    10/6(二)Franciscan A #78工具與程式
  • 從 SWE-ZERO 到 SWE-HERO:軟體工程代理從免執行到基於執行的微調

    10/6(二)Franciscan A #79工具與程式
  • MechMath:以 Sorrifier 驅動的形式化分解工作流程應用於自動定理證明

    10/6(二)Franciscan A #80多元領域與新應用
  • LeanGeo:在 Lean 中形式化競賽幾何問題

    10/6(二)Franciscan B #81多元領域與新應用
  • 信用卡、困惑、計算與後果:我們能從語言模型的推理中發現什麼?

    10/6(二)Franciscan B #82多元領域與新應用
  • CresOWLve:基於真實世界知識的創意問題解決基準測試

    10/6(二)Franciscan B #83評測
  • DRBENCHER:你的代理能辨識實體、檢索其屬性並完成運算嗎?

    10/6(二)Franciscan B #84評測
  • InfiniteScienceGym:一個用於科學分析的無界、程序生成式基準測試

    10/6(二)Franciscan B #85多元領域與新應用
  • MegaScience:推展用於科學推理的開放後訓練資料集之前沿

    10/6(二)Franciscan B #86資料
  • LiteResearcher:用於深度研究代理的可擴展代理式強化學習訓練框架

    10/6(二)Franciscan B #87工具與程式
  • 面向長時程代理任務平行擴展的代理式聚合方法

    10/6(二)Franciscan B #88推論演算法
  • FutureWeaver:以模組化協作規劃多代理系統的測試時運算

    10/6(二)Franciscan B #89推論演算法
  • 測試時擴展使過度訓練成為運算最佳選擇

    10/6(二)Franciscan B #90語言模型科學
  • 大型語言模型的相對縮放律

    10/6(二)Franciscan C #91語言模型科學
  • 成長的陣痛:透過固定參數校準實現可擴展且高效的 LLM 基準測試

    10/6(二)Franciscan C #92評測
  • 跨基準測試通用能力的低成本估計

    10/6(二)Franciscan C #93評測
  • RankBALD:面向語言模型的排名對齊主動評估方法

    10/6(二)Franciscan C #94評測
  • LORA-CRAFT:透過凍結 Tucker 分解對預訓練注意力權重進行跨層秩適應

    10/6(二)Franciscan C #95高效運算
  • Hyperloop Transformers

    10/6(二)Franciscan C #96學習演算法
  • HyperThink:用於高效推理的文字轉參數超網路

    10/6(二)Franciscan C #97高效運算
  • Think Right:透過適應性、注意力導向的壓縮學習緩解思考不足與過度思考

    10/6(二)Franciscan C #98高效運算
  • QLPO:面向長度感知策略最佳化的象限加權採樣

    10/6(二)Franciscan C #99高效運算
  • FIPO:以未來 KL 影響策略最佳化引導深度推理

    10/6(二)Franciscan C #100訓練
  • 從零學習:消失優勢下的策略最佳化

    10/6(二)Grand Ballroom #101訓練
  • 延遲、停滯或崩潰:評估系統性驗證錯誤對 RLVR 的影響

    10/6(二)Grand Ballroom #102訓練
  • 從 RLVR 到 RLSVR:任務轉換為開放式 LLM 自我改進誘發自我可驗證獎勵

    10/6(二)Grand Ballroom #103訓練
  • 混合還是合併:邁向大型語言模型的多領域強化學習

    10/6(二)Grand Ballroom #104訓練
  • 透過兩階段蒸餾建構多任務代理式 LLM

    10/6(二)Grand Ballroom #105訓練
  • 探索多輪自主代理在策略蒸餾中的時序課程學習

    10/6(二)Grand Ballroom #106訓練
  • 重新檢視在策略蒸餾:實證失敗模式與簡單修正方法

    10/6(二)Grand Ballroom #107訓練
  • 語言模型知識蒸餾中的記憶動態

    10/6(二)Grand Ballroom #108語言模型科學
  • 以解碼受限集束搜尋估計語言模型的近逐字萃取風險

    10/6(二)Grand Ballroom #109安全
  • ReLay:個人化 LLM 生成的簡明語言摘要能促進健康資訊理解,但代價是什麼?

    10/6(二)Grand Ballroom #110多元領域與新應用
  • AI 能真正代表你的聲音進行審議嗎?一項針對 LLM 大規模意見彙整的全面研究

    10/6(二)Grand Ballroom #111LM 與世界
  • LLM 作為內容策展人:跨供應商與平台的推薦偏誤大規模稽核

    10/6(二)Grand Ballroom #112評測
  • 單一文化偏誤:大型語言模型中相關聯的偏誤導致招募中不平等的系統性排除率

    10/6(二)Grand Ballroom #113評測
  • 探討量化大型語言模型中的社會偏誤變化

    10/6(二)Grand Ballroom #114高效運算
  • MuonQ:透過方向保真度最佳化強化低位元 Muon 量化

    10/6(二)Grand Ballroom #115高效運算
  • Muon^p:具分數譜冪次的 Muon

    10/6(二)Grand Ballroom #116大型 LM 工程
  • 譜主路徑:大型語言模型中線性表徵形成的譜觀點

    10/6(二)Grand Ballroom #117語言模型科學
  • PCA 引導的活化縮放:對 LLM 諂媚行為進行單調雙向控制

    10/6(二)Grand Ballroom #118語言模型科學
  • 面向多元化 LLM 對齊的溢出感知多價值導引

    10/6(二)Grand Ballroom #119普惠 LM
  • 面向大型語言模型的 Overton 多元化強化學習

    10/6(二)Grand Ballroom #120普惠 LM
  • 透過多目標強化學習與大型語言模型實現柏拉圖最適 RTL 程式碼生成

    10/6(二)Grand Ballroom #121多元領域與新應用
  • 以自我引導擴展自我對弈

    10/6(二)Grand Ballroom #122訓練
  • 多少回溯才夠?探討 SFT 與 RL 在強化 LLM 推理中的交互作用

    10/6(二)Grand Ballroom #123訓練
  • 什麼造就良好的多語推理?以可測量特徵解構推理軌跡

    10/6(二)Grand Ballroom #124普惠 LM
  • 資料選擇對數學推理的效果如何取決於模型容量

    10/6(二)Grand Ballroom #125資料
  • (如何)學習率調節災難性過度訓練

    10/6(二)Grand Ballroom #126語言模型科學
  • GRRR:解碼器 LLM 後訓練中重塑、旋轉與路由的幾何學

    10/6(二)Grand Ballroom #127語言模型科學
  • 準確率相同,幾何結構不同:演化策略與 GRPO 在 LLM 後訓練中的比較

    10/6(二)Grand Ballroom #128訓練
  • 透過幾何對齊恢復微調後多模態 LLM 的泛化能力

    10/6(二)Grand Ballroom #129學習演算法
  • 泛化山脊:自然語言生成中的資訊流

    10/6(二)Grand Ballroom #130語言模型科學
  • Transformer 看與做:複製作為學習類比推理的中間步驟

    10/6(二)Grand Ballroom #131心智、大腦、哲學、法律
  • Transformer 通用推理的障礙(以及如何克服)

    10/6(二)Grand Ballroom #132語言模型科學
  • Transformer 長度泛化的代數分解理論

    10/6(二)Grand Ballroom #133語言模型科學
  • Olmo Hybrid:從理論到實務,再回到理論

    10/6(二)Grand Ballroom #134學習演算法
  • Cylon:非同步線性注意力

    10/6(二)Grand Ballroom #135大型 LM 工程
  • 切換式線性注意力

    10/6(二)Grand Ballroom #136學習演算法
  • IndexCache:透過跨層索引重複使用加速稀疏注意力

    10/6(二)Grand Ballroom #137高效運算
  • 透過漸進樹狀草擬的推測解碼釋放自迴歸語言模型中的平行性

    10/6(二)Grand Ballroom #138高效運算
  • 更快的超詞分詞

    10/6(二)Grand Ballroom #139高效運算
  • 注意力匯與殘差匯的統一觀點:離群值驅動的重新縮放對大型語言模型訓練不可或缺

    ORAL10/6(二)Grand Ballroom #140大型 LM 工程
  • 衡量語言模型預訓練過程中與任務無關的訓練資料影響力

    10/6(二)Grand Ballroom #141資料
  • 隨時更聰明:面向持續 LLM 改進的環境驅動動態策略

    10/6(二)Grand Ballroom #142學習演算法
  • PromptBridge:大型語言模型的跨模型提示遷移

    10/6(二)Grand Ballroom #143訓練
  • 手語模型的音韻感知

    ORAL10/6(二)Grand Ballroom #144多模態 LM
  • 大型語言模型中的歸因偏誤

    ORAL10/6(二)Grand Ballroom #145評測
  • 熬煉後的經驗改善 LLM 代理的測試時推論

    10/7(三)Imperial Ballroom #1推論演算法
  • 自學習診斷代理中推理與雙重記憶的聯合最佳化

    10/7(三)Imperial Ballroom #2多元領域與新應用
  • PolicyBank:為 LLM 代理演化政策理解

    10/7(三)Imperial Ballroom #3工具與程式
  • 透過協作式自我對弈學習可操控的澄清政策

    10/7(三)Imperial Ballroom #4LM 與互動
  • StoryScope:探究 AI 小說中的獨特風格

    10/7(三)Imperial Ballroom #5多元領域與新應用
  • LLM 能夠內省嗎?一次現實檢驗

    10/7(三)Imperial Ballroom #6心智、大腦、哲學、法律
  • LLM 能從自己說過的話中受益嗎?

    10/7(三)Imperial Ballroom #7LM 與互動
  • 對話壓力如何改變大型語言模型的信念:一個隱藏狀態邊界的觀點

    10/7(三)Imperial Ballroom #8LM 與互動
  • 將對話作為臨床問診的測量工具:可觀察的階段結構與部分可觀察的病人狀態

    10/7(三)Imperial Ballroom #9多元領域與新應用
  • 對數分數,冪律發現:在基於代理的評估中釐清測量與涵蓋範圍的差異

    10/7(三)Imperial Ballroom #10評測
  • 自然語言處理領域中多語言、情境化評估的現況與未來

    10/7(三)Imperial Ballroom #11普惠 LM
  • AnchorBench:針對 LLM 錨定效應的多路徑基準測試

    10/7(三)Imperial Ballroom #12心智、大腦、哲學、法律
  • TEMPER:測試量化推理中的情緒擾動

    10/7(三)Imperial Ballroom #13評測
  • 使用大型語言模型對 K-5 學生敘事進行自動化評量的基準測試

    10/7(三)Imperial Ballroom #14多元領域與新應用
  • Qworld:針對 LLM 的題目專屬評估準則

    10/7(三)Imperial Ballroom #15評測
  • 天下沒有白吃的標籤:LLM 作為評審在缺乏人類基準時的侷限

    10/7(三)Imperial Ballroom #16評測
  • 誰來查核引註?法律幻覺偵測的基準測試

    10/7(三)Imperial Ballroom #17LM 與世界
  • 科學出版代理中的 BibTeX 引註錯誤:評估與緩解

    10/7(三)Imperial Ballroom #18LM 與世界
  • 評估指標能否偵測出文言文譯英中的錯誤?

    10/7(三)Imperial Ballroom #19普惠 LM
  • TokEval:一套 tokenizer 分析工具組

    10/7(三)Imperial Ballroom #20評測
  • 為語言模型解碎:一種基於可解釋性的詞彙擴充方法

    10/7(三)Imperial Ballroom #21語言模型科學
  • 趨同演化:不同語言模型如何學到相似的數字表徵

    10/7(三)Imperial Ballroom #22語言模型科學
  • 透過損失曲線分解實現預訓練動態的由下而上可解釋性

    10/7(三)Imperial Ballroom #23語言模型科學
  • 語言模型學到什麼、何時學到?隱性課程假說

    ORAL10/7(三)Imperial Ballroom #24語言模型科學
  • 以稀疏自編碼器理解大型語言模型中的初始效應

    10/7(三)Imperial Ballroom #25語言模型科學
  • 擴散式與自回歸語言模型所生成文本的差異

    10/7(三)Imperial Ballroom #26學習演算法
  • 局部自信,全域卡關:擴散語言模型中的品質-探索兩難

    10/7(三)Imperial Ballroom #27學習演算法
  • 以跨模型分歧作為無標籤正確性訊號

    10/7(三)Imperial Ballroom #28評測
  • 以熵質心作為測試時擴展的內在獎勵

    10/7(三)Imperial Ballroom #29推論演算法
  • 針對信心邊界的過程監督,實現經校準的 LLM 推理

    10/7(三)Imperial Ballroom #30訓練
  • 透過建模多選題問答的可解性,提升過程正確的思維鏈推理

    10/7(三)Imperial Ballroom #31訓練
  • 視覺語言模型的推理動態與監控模態依賴的侷限

    10/7(三)Imperial Ballroom #32多模態 LM
  • MonitorBench:針對大型語言模型思維鏈可監控性的綜合基準測試

    10/7(三)Imperial Ballroom #33評測
  • 可讀性不等於可解釋性:評估思維鏈推理步驟中的判定重要性與實際重要性

    10/7(三)Imperial Ballroom #34語言模型科學
  • 為何自我蒸餾有時會削弱 LLM 的推理能力?

    10/7(三)Imperial Ballroom #35訓練
  • 超越軌跡模仿:針對 LLM 推理的策略導向政策最佳化

    10/7(三)Imperial Ballroom #36訓練
  • 演化式程式化技能網路

    10/7(三)Imperial Ballroom #37工具與程式
  • CoEvoSkills:透過共演化驗證實現代理技能的自我演化

    10/7(三)Imperial Ballroom #38工具與程式
  • REVERE:反思式演化研究工程師

    10/7(三)Imperial Ballroom #39工具與程式
  • p1:以更少提示實現更好的提示最佳化

    10/7(三)Imperial Ballroom #40訓練
  • 與什麼比較?反事實提示的基準與評估指標

    10/7(三)Imperial Ballroom #41評測
  • 問法決定一切:LLM 中與性別相關的語言偏誤

    10/7(三)Imperial Ballroom #42評測
  • 伸手探入合唱團:自由列舉法揭露 LLM 集成中各異的模型聲音

    10/7(三)Imperial Ballroom #43評測
  • 在全雙工語音模型中解放 LLM 能力

    10/7(三)Imperial Ballroom #44多模態 LM
  • 學習繪製 ASCII 圖能提升語言模型的空間推理能力

    10/7(三)Imperial Ballroom #45推論演算法
  • 極座標探針能以線性方式從 LLM 中解碼語意結構

    10/7(三)Imperial Ballroom #46語言模型科學
  • 大型語言模型在情境學習過程中會重組其表徵幾何結構

    10/7(三)Imperial Ballroom #47語言模型科學
  • 將情境學習視為隱性政策梯度

    10/7(三)Imperial Ballroom #48語言模型科學
  • GradAlign:針對 LLM 強化學習的梯度對齊資料選擇法

    10/7(三)Imperial Ballroom #49資料
  • LLM 的風險樣貌剖析與調節

    10/7(三)Imperial Ballroom #50訓練
  • 故事塑造代理:LLM 行為中的敘事先驗

    10/7(三)Imperial Ballroom #51評測
  • 測量 LLM 指令中的語用影響力

    10/7(三)Imperial Ballroom #52評測
  • HieraSuite:一套用於建構多用途系統-使用者指令層級的整合工具組

    10/7(三)Imperial Ballroom #53安全
  • LogicIF:邁向複雜邏輯指令遵循

    10/7(三)Imperial Ballroom #54訓練
  • Quokka:透過不變量合成,以 LLM 加速程式驗證

    10/7(三)Imperial Ballroom #55工具與程式
  • BugScope:學習像人類一樣偵測程式錯誤

    ORAL10/7(三)Imperial Ballroom #56工具與程式
  • 程式碼代理不知道何時該動手

    10/7(三)Imperial Ballroom #57工具與程式
  • 誰來監督基準測試?LLM 代理基準測試的自動化稽核

    10/7(三)Imperial Ballroom #58評測
  • WildTableBench:在真實情境下對多模態基礎模型的表格理解能力進行基準測試

    10/7(三)Imperial Ballroom #60多模態 LM
  • SciTaRC:一套帶有計畫標註的科學表格問答基準測試,用於語言推理與複雜計算

    10/7(三)Imperial Ballroom #61評測
  • ArtifactLinker:連結科學構件以自動發現最先進成果

    10/7(三)Imperial Ballroom #62工具與程式
  • 從論文到全景:大規模建構科學文獻的層級結構

    10/7(三)Imperial Ballroom #63多元領域與新應用
  • 「文件即圖像」表徵法在科學檢索上表現不足

    10/7(三)Imperial Ballroom #64多模態 LM
  • 透過預測性嵌入實現多模態潛在推理

    10/7(三)Imperial Ballroom #65多模態 LM
  • VERIFY:針對多模態推理忠實度的視覺推理基準測試

    10/7(三)Imperial Ballroom #66多模態 LM
  • AVMeme Exam:針對 LLM 情境與文化知識及思維的多模態、多語言、多文化基準測試

    10/7(三)Imperial Ballroom #67多模態 LM
  • NormViz:將多模態推理根植於全球文化的基準測試與框架

    10/7(三)Imperial Ballroom #68多模態 LM
  • VisCodeBench:一套反映真實世界實務、用於文字轉視覺化的全新基準資料集

    10/7(三)Imperial Ballroom #69工具與程式
  • CT-ΔBench:利用視覺語言模型進行縱向 3D 醫學影像差異報告的基準測試

    10/7(三)Imperial Ballroom #70多元領域與新應用
  • CT Open:一個開放存取、無污染的即時平台,用於臨床試驗結果預測的開放挑戰

    10/7(三)Imperial Ballroom #71多元領域與新應用
  • SatIR:可擴展、高召回率、基於約束滿足的臨床試驗配對資訊檢索

    10/7(三)Imperial Ballroom #72多元領域與新應用
  • TierCache:針對結構化查詢生成的多粒度語意快取框架

    10/7(三)Imperial Ballroom #73大型 LM 工程
  • 透過語意空間中的雙階段信心測量,緩解檢索增強生成的知識衝突

    10/7(三)Franciscan A #74LM 與世界
  • KARL:透過知識邊界感知強化學習緩解 LLM 幻覺

    10/7(三)Franciscan A #75LM 與世界
  • 幻覺自我對弈:透過演化生成器自舉強化偵測器

    10/7(三)Franciscan A #76LM 與世界
  • 高效能強化學習環境的自動生成

    10/7(三)Franciscan A #77大型 LM 工程
  • 什麼造就一筆交易?用 LLM 代理模擬端到端的賣家—買家零售動態

    10/7(三)Franciscan A #78LM 與世界
  • CivBench:基於進程的評估,測試 LLM 在《文明帝國 V》中的策略決策能力

    10/7(三)Franciscan A #79評測
  • VehicleMemBench:車載代理多使用者長期記憶的可執行基準測試

    10/7(三)Franciscan A #80工具與程式
  • iOSWorld:具個人化使用者身分與記憶的真實 iOS 環境,用於手機代理基準測試

    10/7(三)Franciscan B #81工具與程式
  • InjecMEM:針對 LLM 代理記憶系統的記憶注入攻擊

    10/7(三)Franciscan B #82安全
  • InfMem:為長情境代理學習系統二式記憶控制

    10/7(三)Franciscan B #83LM 與世界
  • 思維速記:透過熵值引導的超級 token 壓縮 LLM 推理

    10/7(三)Franciscan B #85高效運算
  • ReflCtrl:透過表徵工程高效控制 LLM 反思行為

    10/7(三)Franciscan B #86高效運算
  • RankGuide:張量秩引導的路由與引導機制,實現高效推理

    10/7(三)Franciscan B #87高效運算
  • 超越 Logit 調整:長尾重排序的殘差分解框架

    10/7(三)Franciscan B #88多元領域與新應用
  • 透過機率偏好基底的不確定性感知變分獎勵分解,實現 LLM 個人化

    10/7(三)Franciscan B #89LM 與互動
  • CIDER:用於隱私偏好對齊的情境揭露邊界資料集

    10/7(三)Franciscan B #90安全
  • SOTOPIA-TOM:以心智理論評估多代理互動中的隱私與資訊管理

    10/7(三)Franciscan C #91LM 與互動
  • SNEAK:評估大型語言模型中的策略性溝通與資訊洩漏

    10/7(三)Franciscan C #92LM 與互動
  • StateBridge:免訓練的隱藏狀態對齊,實現 LLM 多代理系統的潛在溝通

    10/7(三)Franciscan C #93LM 與互動
  • 學習在基於語言的多代理溝通中插話

    10/7(三)Franciscan C #94LM 與互動
  • 當情境推論失效時:互動式指令遵循中的可取消性

    10/7(三)Franciscan C #95LM 與互動
  • 以自我協商契約承諾合作

    10/7(三)Franciscan C #96LM 與互動
  • 代理系統對抗對抗性誘發有害行為的穩健性基準測試

    10/7(三)Franciscan C #97安全
  • TraceSafe:LLM 護欄在多步驟工具呼叫軌跡上的系統性評估

    10/7(三)Franciscan C #98安全
  • 為什麼安全護欄會隨語言而失效?

    10/7(三)Franciscan C #99安全
  • 一次一個詞:漸進式補全分解破解 LLM 安全性

    10/7(三)Franciscan C #100安全
  • 大型語言模型越獄成功的最小化、局部性因果解釋

    10/7(三)Grand Ballroom #101安全
  • 引導向量的安全代價是可分離且可降低的

    10/7(三)Grand Ballroom #102安全
  • RefusalGuard:LLM 安全性的保幾何微調

    10/7(三)Grand Ballroom #103安全
  • 解耦對齊,實現穩健的即插即用調適

    10/7(三)Grand Ballroom #104安全
  • FPEdit:透過局部參數編輯實現穩健的 LLM 指紋辨識

    10/7(三)Grand Ballroom #105安全
  • 蒸餾以偵測:透過卡匣蒸餾揭露 LLM 中的隱蔽偏誤

    10/7(三)Grand Ballroom #106安全
  • 一例即可偏誤全體:單樣本 GRPO 的破壞性

    10/7(三)Grand Ballroom #108安全
  • CLIP 是鬥雞眼嗎?揭露並緩解 CLIP 家族中的中心偏誤

    10/7(三)Grand Ballroom #109多模態 LM
  • 超越語意:重新發現視覺語言模型中的空間意識

    10/7(三)Grand Ballroom #110多模態 LM
  • 強化學習究竟改善了視覺推理的哪些能力?一項科學怪人式分析

    10/7(三)Grand Ballroom #111多模態 LM
  • Apriel-Reasoner:面向通用且高效推理的強化學習後訓練

    10/7(三)Grand Ballroom #112訓練
  • 重新思考推理 SFT 中的泛化能力:針對最佳化、資料與模型能力的條件性分析

    ORAL10/7(三)Grand Ballroom #113訓練
  • 論推理模式在長思維鏈監督式微調泛化差異中的角色

    10/7(三)Grand Ballroom #114訓練
  • 循環、思考、泛化:循環深度 Transformer 中的隱式推理

    10/7(三)Grand Ballroom #115學習演算法
  • Transformer 如何透過多 token 預測學會規劃

    10/7(三)Grand Ballroom #116語言模型科學
  • MLP 即 Hebbian:為 Transformer 建構高效的事實儲存 MLP

    10/7(三)Grand Ballroom #117語言模型科學
  • 大規模程序性知識改善推理能力

    10/7(三)Grand Ballroom #118LM 與世界
  • QED-Nano:教導小型模型證明困難定理

    10/7(三)Grand Ballroom #119多元領域與新應用
  • LiveMathematicianBench:結合證明草圖的研究級數學推理即時基準測試

    10/7(三)Grand Ballroom #120多元領域與新應用
  • MathDuels:會不斷成長的自我對弈基準測試

    10/7(三)Grand Ballroom #121多元領域與新應用
  • BigCodeArena:可執行程式碼生成評估平台

    10/7(三)Grand Ballroom #122工具與程式
  • Meta-Harness:模型鷹架的端到端最佳化

    10/7(三)Grand Ballroom #123工具與程式
  • 語言模型代理中的獎勵駭客行為:重新審視 AI 安全網格世界

    10/7(三)Grand Ballroom #124安全
  • 開始分類:LLM 強化學習的類別式評論者

    10/7(三)Grand Ballroom #125訓練
  • 源自稀疏真實世界結果的評分規準監督評論者

    10/7(三)Grand Ballroom #126訓練
  • 從評分規準到 Token:銜接指令遵循任務中回應層級評分規準與 Token 層級獎勵

    10/7(三)Grand Ballroom #127訓練
  • 重新思考獎勵監督:評分規準條件式自我蒸餾

    10/7(三)Grand Ballroom #128訓練
  • 透過樣本路由統一群組相對與自我蒸餾策略最佳化

    10/7(三)Grand Ballroom #129訓練
  • Headroom-Drift Replay:GRPO 中原則性重播控制的基本單元

    10/7(三)Grand Ballroom #130訓練
  • Faithful GRPO:透過約束策略最佳化改善多模態語言模型的視覺空間推理

    10/7(三)Grand Ballroom #131多模態 LM
  • OpenVLThinkerV2:面向多領域視覺任務的通用型多模態推理模型

    10/7(三)Grand Ballroom #132多模態 LM
  • Bagpiper:透過豐富字幕描述解決開放式音訊任務

    10/7(三)Grand Ballroom #133多模態 LM
  • TEMPURA:面向動作推理的時間事件遮罩預測與理解

    10/7(三)Grand Ballroom #134多模態 LM
  • FOCUS:高效視覺語言理解的閉環注意力回饋

    10/7(三)Grand Ballroom #135高效運算
  • 批次自適應剪枝:面向語言推理模型的週期性神經元活化感知權重剪枝

    10/7(三)Grand Ballroom #136高效運算
  • 用於因果迴路發現的多粒度節點剪枝

    10/7(三)Grand Ballroom #137語言模型科學
  • 當更少層數破壞更多鏈條:層剪枝損害 LLM 的測試期擴展能力

    10/7(三)Grand Ballroom #138高效運算
  • Lang-Prune:為多語言大型語言模型解鎖公平且強大的剪枝

    10/7(三)Grand Ballroom #139高效運算
  • ADMM-Q:用於大型語言模型訓練後量化之改進版海森矩陣權重量化器

    10/7(三)Grand Ballroom #140高效運算
  • QVAC Genesis III:用於高效語言模型預訓練之大規模、高品質開放合成 STEM 語料庫

    10/7(三)Grand Ballroom #141資料
  • MidTool:面向代理式工具使用的中期訓練資料合成

    10/7(三)Grand Ballroom #142資料
  • 建立工具的 LLM 代理,從保留工具中獲益甚微

    10/7(三)Grand Ballroom #143工具與程式
  • 人類與 LLM 在信念修正上是否存在分歧?來自貝氏分析的證據

    ORAL10/7(三)Grand Ballroom #144心智、大腦、哲學、法律
  • 透過注意力頭重新加權實現 LLM 的資料高效調適

    10/7(三)Imperial Ballroom #1高效運算
  • 一種先驗感知指標,用於高效區分大型語言模型中的記憶與泛化

    10/7(三)Imperial Ballroom #2語言模型科學
  • 語言模型知道卻未說出的事:用於泛化的非生成式先驗萃取

    10/7(三)Imperial Ballroom #3語言模型科學
  • 超越羅塞塔石碑:泛化動態中的統一力量

    ORAL10/7(三)Imperial Ballroom #4語言模型科學
  • 對多語言大型語言模型生成內容中翻譯腔的調查研究

    10/7(三)Imperial Ballroom #5普惠 LM
  • 用於社會科學的多語言代理式世界建模

    10/7(三)Imperial Ballroom #6LM 與世界
  • 社會世界模型

    10/7(三)Imperial Ballroom #7心智、大腦、哲學、法律
  • 用於世界建模的神經符號協同(Neuro-Symbolic Synergy)

    10/7(三)Imperial Ballroom #8LM 與世界
  • 神經符號 PRM:透過結構化推理軌跡與符號驗證提升科學推理能力

    10/7(三)Imperial Ballroom #9推論演算法
  • 從健全推理得出正確答案:語言模型的可驗證過程監督

    10/7(三)Imperial Ballroom #10訓練
  • Odysseus:透過強化學習將視覺語言模型擴展至遊戲中 100 輪以上的決策任務

    10/7(三)Imperial Ballroom #11LM 與具身
  • 從人機互動中學習下一步行動預測器

    10/7(三)Imperial Ballroom #12LM 與互動
  • FinTrace:針對長時間跨度金融任務的 LLM 工具呼叫全面軌跡層級評估

    10/7(三)Imperial Ballroom #13多元領域與新應用
  • YC-Bench:針對長期規劃與一致執行能力的 AI 代理基準測試

    10/7(三)Imperial Ballroom #14評測
  • DeliveryBench:代理能在模擬世界中賺取利潤嗎?

    10/7(三)Imperial Ballroom #15LM 與世界
  • UrbanLLMind:以開放權重模型驅動的可擴展 LLM 城市移動模擬

    10/7(三)Imperial Ballroom #16LM 與世界
  • Agent Bazaar:在多代理市場中實現經濟對齊

    10/7(三)Imperial Ballroom #17LM 與世界
  • 合作特徵能預測多代理 LLM 團隊在 AI for Science 工作流程中的表現

    10/7(三)Imperial Ballroom #18LM 與互動
  • LLM 代理中的溝通與驗證:邁向資訊不對稱下的協作

    10/7(三)Imperial Ballroom #19LM 與互動
  • 協作落差:開放世界代理式合作的探索與基準測試

    10/7(三)Imperial Ballroom #20LM 與互動
  • 群體演化代理:透過經驗分享實現開放式自我改進

    10/7(三)Imperial Ballroom #21LM 與互動
  • 在神經科學資料到發現流程上評估 AI 代理的案例研究

    10/7(三)Imperial Ballroom #22多元領域與新應用
  • PaperOrchestra:用於自動化 AI 研究論文寫作的多代理框架

    10/7(三)Imperial Ballroom #23多元領域與新應用
  • OpenMobile:透過任務與軌跡合成建構開放式行動代理

    10/7(三)Imperial Ballroom #24工具與程式
  • MTA-Agent:多模態深度搜尋代理的開放配方

    10/7(三)Imperial Ballroom #25工具與程式
  • 銜接資料庫與文件:混合式問答的資料—演算法協同設計

    10/7(三)Imperial Ballroom #26工具與程式
  • DataSTORM:運用探索性資料分析與資料敘事對大規模資料庫進行深度研究

    10/7(三)Imperial Ballroom #27工具與程式
  • CoreSemDB:針對文字豐富資料庫的混合語意—關聯式查詢處理基準測試

    10/7(三)Imperial Ballroom #28評測
  • VeriSoftBench:針對 Lean 的儲存庫規模形式化驗證基準測試

    10/7(三)Imperial Ballroom #29工具與程式
  • 為電腦使用代理建構驗證器的藝術

    10/7(三)Imperial Ballroom #30工具與程式
  • ComponentBench:診斷電腦使用代理的元件層級失敗

    10/7(三)Imperial Ballroom #31工具與程式
  • CAP:針對具複雜行動與感知能力的跨網站瀏覽器代理之可擴展評估基準

    10/7(三)Imperial Ballroom #32工具與程式
  • WebChoreArena:針對真實繁瑣網頁任務評估網頁瀏覽代理

    10/7(三)Imperial Ballroom #33工具與程式
  • 回到未來:用於試算表建立基準測試的工作簿時光機

    10/7(三)Imperial Ballroom #34評測
  • 造假的多種方式:策略導向 AI 生成下的假新聞偵測基準測試

    10/7(三)Imperial Ballroom #35安全
  • 超越困惑度(Perplexity):字元分布特徵與用於 AI 文字偵測的 MDTA 基準測試

    10/7(三)Imperial Ballroom #36安全
  • 人類與 LLM 如何從「性別中立」的外貌描述中讀出性別

    10/7(三)Imperial Ballroom #37普惠 LM
  • 從個體到互動:透過社會關係視角對多模態大型語言模型中的性別偏誤進行基準測試

    10/7(三)Imperial Ballroom #38普惠 LM
  • LLM 反映了誰的立場?揭露並緩解知識性盲點

    10/7(三)Imperial Ballroom #39普惠 LM
  • 資源越少,分數越高:LLM 評判者中的語言偏誤

    10/7(三)Imperial Ballroom #40評測
  • 懲罰長度:揭露品質評估指標中的系統性偏誤

    10/7(三)Imperial Ballroom #41評測
  • 長度價值模型:用於 token 層級長度建模的可擴展價值預訓練

    10/7(三)Imperial Ballroom #42高效運算
  • SCOPE:LLM 提示壓縮的生成式方法

    10/7(三)Imperial Ballroom #43高效運算
  • 光學情境壓縮只不過是(糟糕的)自編碼

    10/7(三)Imperial Ballroom #44高效運算
  • SideQuest:針對長時間跨度代理式工作負載的模型驅動 KV 快取管理

    10/7(三)Imperial Ballroom #45高效運算
  • Free():在僅具 Malloc 特性的推理模型中學習遺忘

    10/7(三)Imperial Ballroom #46高效運算
  • 具信心度的分岔思考(Fork-think with Confidence)

    10/7(三)Imperial Ballroom #47推論演算法
  • 推理模型中的測試時擴展,對知識密集型任務而言尚未有效

    10/7(三)Imperial Ballroom #48推論演算法
  • 取樣、對齊、合成:以 ConGrs 進行基於圖的回應合成

    10/7(三)Imperial Ballroom #49推論演算法
  • 從機制發現到提案收斂:用於科學構想的圖立基階層式搜尋

    10/7(三)Imperial Ballroom #50多元領域與新應用
  • CrystalSTAR:用於受限新晶體發現的三重反思結構化行動協調

    10/7(三)Imperial Ballroom #51多元領域與新應用
  • MetaSymbO:透過符號潛在演化實現多代理語言引導的超材料發現

    10/7(三)Imperial Ballroom #52多元領域與新應用
  • AMAT:透過強化學習實現自動化多代理拓撲設計

    10/7(三)Imperial Ballroom #53LM 與互動
  • 學習遵循規範:用於訓練程序合規代理的工作流程立基環境生成

    10/7(三)Imperial Ballroom #54工具與程式
  • RewardHarness:僅以 100 個示範學習影像編輯的人類偏好

    10/7(三)Imperial Ballroom #55多模態 LM
  • PrefPO:成對偏好提示最佳化

    10/7(三)Imperial Ballroom #56訓練
  • GoodPoint:從作者回應中學習具建設性的科學論文回饋

    10/7(三)Imperial Ballroom #57多元領域與新應用
  • AI 輔助科學寫作的過程導向評估

    10/7(三)Imperial Ballroom #58多元領域與新應用
  • 當你委派任務時,LLM 會弄壞你的文件

    10/7(三)Imperial Ballroom #59LM 與互動
  • 持久狀態 AI 控制中的分散式攻擊

    ORAL10/7(三)Imperial Ballroom #60安全
  • 透過注意力集中實現偏好重定向:針對電腦使用代理的攻擊

    10/7(三)Imperial Ballroom #61安全
  • 透過情境內經驗重播與語意保留提示改寫對文字轉影像模型進行紅隊測試

    10/7(三)Imperial Ballroom #62安全
  • FoR-SALE:基於 LLM 擴散編輯中參考框架引導的空間調整

    10/7(三)Imperial Ballroom #63多模態 LM
  • RELISH:具潛在迭代狀態頭的 LLM 迴歸

    10/7(三)Imperial Ballroom #64學習演算法
  • 估計器的喜劇:論 LLM 強化學習訓練中的 KL 正規化

    10/7(三)Imperial Ballroom #65訓練
  • Reinforce-Ada:非線性強化學習目標下的自適應取樣框架

    10/7(三)Imperial Ballroom #66訓練
  • SonicSampler:用於 LLM 取樣與推測性驗證的統一分塊感知核心

    10/7(三)Imperial Ballroom #67大型 LM 工程
  • NI Sampling++:利用強化學習最佳化 token 順序以實現快速離散擴散取樣

    10/7(三)Imperial Ballroom #68推論演算法
  • 用於擴散語言模型的遮罩感知策略梯度

    10/7(三)Imperial Ballroom #69訓練
  • 用於少步驟生成的多重遮罩擴散語言模型

    10/7(三)Imperial Ballroom #70學習演算法
  • 用於加速大型語言模型的雙串流解碼

    10/7(三)Imperial Ballroom #72高效運算
  • 用於大型有限集合受限解碼的字典樹自動機(Trie Automata)

    10/7(三)Imperial Ballroom #73推論演算法
  • 當音訊語言模型無法善用多模態情境進行構音障礙語音辨識

    10/7(三)Franciscan A #74多模態 LM
  • MURMUR:泰米爾語與約魯巴語開放式問答的跨語言多模態檢索增強推理

    10/7(三)Franciscan A #75普惠 LM
  • 為何視覺無法作為通用橋樑:修正多語言 MLLM 中的模態異步問題

    10/7(三)Franciscan A #76多模態 LM
  • 仲裁失敗,而非知覺盲區:視覺語言模型如何解決視覺—語言衝突

    10/7(三)Franciscan A #77多模態 LM
  • 語言的代價:形心抹除揭露並利用多模態語言模型中的模態競爭

    10/7(三)Franciscan A #78多模態 LM
  • 眼見不一定為憑:揭露評估者視覺語言模型的盲點

    10/7(三)Franciscan A #79多模態 LM
  • VLM 需要文字:視覺語言模型偏好語意錨點而忽略視覺細節

    10/7(三)Franciscan A #80多模態 LM
  • 語意豐富性還是幾何推理?VLM 視覺不變性的脆弱性

    10/7(三)Franciscan B #81多模態 LM
  • 多模態語言模型無法察覺空間不一致

    10/7(三)Franciscan B #82多模態 LM
  • 從看似合理到有憑有據:強化影片 MLLM 的結構化一致性

    10/7(三)Franciscan B #83多模態 LM
  • TGIF:文字引導層融合可緩解多模態 LLM 的幻覺

    10/7(三)Franciscan B #84多模態 LM
  • 創造力與幻覺在 LLM 中共享機制

    10/7(三)Franciscan B #85語言模型科學
  • 在詞彙空間中解構 MLP 神經元權重

    10/7(三)Franciscan B #86語言模型科學
  • 野外的算術:Llama 使用標準加法推理循環概念

    10/7(三)Franciscan B #87語言模型科學
  • 因果吊橋:刻畫 Transformer 語言模型中句法孤島的梯度阻斷

    10/7(三)Franciscan B #88心智、大腦、哲學、法律
  • 無干擾的疊加?透過近乎正交特徵實現語言模型的孤立介入

    10/7(三)Franciscan B #89語言模型科學
  • LangFIR:從單語資料中發掘稀疏的語言特定特徵以進行語言導引

    10/7(三)Franciscan B #90語言模型科學
  • 以人類相似性判斷評估導引技術

    10/7(三)Franciscan C #91心智、大腦、哲學、法律
  • 導引意識:從內部偵測活化導引

    10/7(三)Franciscan C #92安全
  • 在推論時導引指令階層

    10/7(三)Franciscan C #93安全
  • Instruct-FD:你的全雙工語音系統能遵循輪替指令嗎?

    10/7(三)Franciscan C #94LM 與互動
  • SEQUOR:貼近真實情境的多輪限制條件遵循基準測試

    10/7(三)Franciscan C #95LM 與互動
  • COMPASS:為 LLM 代理的受限最佳化能力建立基準測試

    10/7(三)Franciscan C #96工具與程式
  • 大型語言模型在規劃問題上最佳性之分析

    10/7(三)Franciscan C #97推論演算法
  • 深度天花板:論大型語言模型在發掘潛在規劃能力上的限制

    10/7(三)Franciscan C #98推論演算法
  • KTPO:用於長時程發現的 K 步測試時策略最佳化

    10/7(三)Franciscan C #99推論演算法
  • ACTOR-CURATOR:透過策略改進式拉霸機演算法進行強化學習後訓練的線上課程學習

    10/7(三)Franciscan C #100訓練
  • 用於 LLM 推理的自我演化課程

    10/7(三)Grand Ballroom #101訓練
  • 新技能還是更精準的基本單元?從機率角度看 RLVR 中推理能力的湧現

    10/7(三)Grand Ballroom #102語言模型科學
  • 超越分布銳化:任務獎勵的重要性

    ORAL10/7(三)Grand Ballroom #103訓練
  • 從反彈到補救:透過表徵工程理解並緩解獎勵駭客行為

    10/7(三)Grand Ballroom #104訓練
  • 往返強化學習:為更好的化學 LLM 進行自我一致性訓練

    10/7(三)Grand Ballroom #105多元領域與新應用
  • CONCORD:透過展開一致性對語言化 LLM 信心進行無標籤校準

    10/7(三)Grand Ballroom #106語言模型科學
  • PAM:從政策衍生監督訓練內容審核過濾器

    10/7(三)Grand Ballroom #107安全
  • 拒絕樣本的品質至關重要:為忠實摘要建構偏好資料

    10/7(三)Grand Ballroom #108資料
  • 劇透警告:以敘事預測作為 LLM 說故事張力的評量指標

    10/7(三)Grand Ballroom #109評測
  • 從感覺到指標:理解並形式化使用者如何對 LLM 進行氛圍測試

    10/7(三)Grand Ballroom #110評測
  • SWE-chat:來自真實使用者的野外程式撰寫代理互動紀錄

    10/7(三)Grand Ballroom #111工具與程式
  • 魔鬼藏在介面之中:評估工具架構如何形塑程式撰寫代理的行為

    10/7(三)Grand Ballroom #112工具與程式
  • FitText:透過迷因式檢索演化代理工具生態系

    10/7(三)Grand Ballroom #113工具與程式
  • CHASE:當排名成為唯一目標時,內容生態系如何被重塑

    10/7(三)Grand Ballroom #114LM 與世界
  • 當 RAG 未能拉平落差:上市公司事實性問答中的地域偏誤

    10/7(三)Grand Ballroom #115LM 與世界
  • 只問你所不知道的:高效多步驟 RAG 的有依據增量規劃

    10/7(三)Grand Ballroom #116LM 與世界
  • RAQE:透過無標籤群組相對策略最佳化的重排序器對齊查詢擴展

    10/7(三)Grand Ballroom #117LM 與世界
  • AgentIR:面向深度研究代理的推理感知檢索

    10/7(三)Grand Ballroom #118工具與程式
  • ResearcherBench:在開放式 AI 研究任務上評估深度 AI 研究系統

    10/7(三)Grand Ballroom #119評測
  • Sci-VBench:評估科學領域中知識與推理密集型的影片生成

    10/7(三)Grand Ballroom #120多模態 LM
  • ScienceMeter:追蹤語言模型中的科學知識更新

    10/7(三)Grand Ballroom #121LM 與世界
  • 科學領域中 LLM 日益縮短的生命週期

    10/7(三)Grand Ballroom #122多元領域與新應用
  • 思考的隱藏代價:預訓練之外語言模型的能源使用與環境影響

    10/7(三)Grand Ballroom #123大型 LM 工程
  • 透過擴展合成巨型文件實現資料效率化的預訓練

    10/7(三)Grand Ballroom #124資料
  • 從天然資料生成預訓練 Token 以實現資料受限的擴展

    10/7(三)Grand Ballroom #125資料
  • 我們如何合成高品質的預訓練資料?提示設計、生成器模型與來源資料的系統性研究

    ORAL10/7(三)Grand Ballroom #126資料
  • FineInstructions:將合成指令擴展至預訓練規模

    10/7(三)Grand Ballroom #127資料
  • LM-mixup:透過以語言模型為基礎的 Mixup 進行文字資料增強

    10/7(三)Grand Ballroom #128資料
  • 抽取論證,而非只是分類:用於生成式成分偵測的指令微調 LLM

    10/7(三)Grand Ballroom #129訓練
  • 自動化還是受控?重複促發揭露基礎 LLM、指令 LLM 與人類之間的處理分歧

    10/7(三)Grand Ballroom #130心智、大腦、哲學、法律
  • 情境內範例會抑制 LLM 的科學知識回想

    10/7(三)Grand Ballroom #131訓練
  • 運用測試時運算改善潛在泛化能力

    10/7(三)Grand Ballroom #132推論演算法
  • 會思考的語言模型,聊天聊得更好

    10/7(三)Grand Ballroom #133訓練
  • 光譜上的推理:將 LLM 對齊到系統一與系統二思維

    10/7(三)Grand Ballroom #134心智、大腦、哲學、法律
  • 以 MDLM 重新思考推理:提前退出、事後推理及更多可能

    10/7(三)Grand Ballroom #135學習演算法
  • 潛在推理模型容易解釋嗎?

    10/7(三)Grand Ballroom #136語言模型科學
  • 在 Transformer 推理中為潛在演算法路由建立根基

    10/7(三)Grand Ballroom #137語言模型科學
  • LLM 路由器:以預填活化重新思考路由

    10/7(三)Grand Ballroom #138推論演算法
  • 多樣性沒有單一最佳模型:為樣本多樣性學習一個路由器

    10/7(三)Grand Ballroom #139推論演算法
  • 路由熵:專家混合 LLM 中免費附贈的隱藏自我驗證器

    10/7(三)Grand Ballroom #140學習演算法
  • 參數高效 LLM 微調中 LoRA 混合的強化路由

    10/7(三)Grand Ballroom #141高效運算
  • ExpertWeave:大規模高效服務專家專門化微調適配器

    10/7(三)Grand Ballroom #142大型 LM 工程
  • 讓我們逐步擴展:大規模專家混合模型的運算高效超參數轉移

    10/7(三)Grand Ballroom #143大型 LM 工程
  • 拒絕行為墜落懸崖:安全對齊在推理中如何失效?

    10/8(四)Imperial Ballroom #1安全
  • 利潤對齊問題:利潤指令如何在 LLM 中誘發對齊失敗

    10/8(四)Imperial Ballroom #2安全
  • 湧現式不忠實:對齊訓練如何使語言模型悄悄凌駕任務忠實度

    10/8(四)Imperial Ballroom #3安全
  • 透過潛在人格特質實現語言模型的高效安全對齊

    10/8(四)Imperial Ballroom #4安全
  • 在不犧牲連貫性的情況下,以活化導引實現對齊的開放式生成

    10/8(四)Imperial Ballroom #5安全
  • 從幾何到行為:指令暴露如何解鎖 LLM 中的潛在修辭方向

    10/8(四)Imperial Ballroom #6語言模型科學
  • 大型語言模型中情感表徵的潛在結構

    10/8(四)Imperial Ballroom #7語言模型科學
  • 多輪 LLM 對話中浮現的吸子狀態

    10/8(四)Imperial Ballroom #8LM 與互動
  • STATe-of-Thoughts:用於 Tree-of-Thoughts 的結構化行動模板

    10/8(四)Imperial Ballroom #9推論演算法
  • 認知思維鏈(Cognitive Chain-of-Thought,CoCoT):針對社交情境的結構化多模態推理

    10/8(四)Imperial Ballroom #10心智、大腦、哲學、法律
  • DeepThinkVLA:提升視覺-語言-行動模型的推理能力

    10/8(四)Imperial Ballroom #11LM 與具身
  • 解耦可指令代理的規劃與控制

    10/8(四)Imperial Ballroom #12LM 與具身
  • 從使用者互動對齊語言模型

    10/8(四)Imperial Ballroom #13LM 與互動
  • 語言模型推理的同儕預測式自我訓練

    10/8(四)Imperial Ballroom #14訓練
  • 透過強化學習實現變分共同演化

    10/8(四)Imperial Ballroom #15訓練
  • 詞彙丟棄法(Vocabulary Dropout)用於 LLM 共同演化中的課程多樣性

    10/8(四)Imperial Ballroom #16訓練
  • 論大型語言模型中的知識多樣性

    10/8(四)Imperial Ballroom #17評測
  • CreativityNeuro:透過操縱語言模型權重提升發散思考並降低模式崩潰

    10/8(四)Imperial Ballroom #18語言模型科學
  • Path-Lock Expert:透過架構層級分離,在混合思考模式中分離推理模式

    10/8(四)Imperial Ballroom #19學習演算法
  • 推理微調會誘發持續性的潛在策略狀態

    10/8(四)Imperial Ballroom #20語言模型科學
  • 當場逮到合理化行為:透過激活探測偵測思維鏈前後的動機性推理

    10/8(四)Imperial Ballroom #21語言模型科學
  • 連貫性的幻象:隱喻如何影響語言模型的語篇連貫性評估

    ORAL10/8(四)Imperial Ballroom #22心智、大腦、哲學、法律
  • 我們該對機器翻譯中的推理錯誤吹毛求疵嗎?

    10/8(四)Imperial Ballroom #23普惠 LM
  • MELD:透過邏輯辯論實現的多語言集成

    10/8(四)Imperial Ballroom #24普惠 LM
  • TowerVision:理解並改善視覺語言模型中的多語言能力

    10/8(四)Imperial Ballroom #25普惠 LM
  • LF²AR:考量逐層動態以改善語言模型的多模態適應

    10/8(四)Imperial Ballroom #26多模態 LM
  • DARE:擴散式大型語言模型對齊與強化執行器

    10/8(四)Imperial Ballroom #27訓練
  • 雙重溫度的故事:從擴散語言模型進行簡單、高效且多樣的取樣

    10/8(四)Imperial Ballroom #28推論演算法
  • 超越事後溫度縮放:用於 LLM 校準的雙層最佳化

    10/8(四)Imperial Ballroom #29語言模型科學
  • 過度自信且對細節視而不見:以溯因偏好學習修正提示不敏感性問題

    10/8(四)Imperial Ballroom #30訓練
  • 基於均勻資訊密度的偏好最佳化

    10/8(四)Imperial Ballroom #31訓練
  • A11yn:針對網頁無障礙感知的使用者介面生成對齊 LLM

    10/8(四)Imperial Ballroom #32工具與程式
  • 大型視覺語言模型準備好引導視障與低視力人士了嗎?

    10/8(四)Imperial Ballroom #33多模態 LM
  • GLAZE:用於將人類視線鎖定於網頁使用者介面的視線-語言基準測試

    10/8(四)Imperial Ballroom #34多模態 LM
  • 視覺美學基準測試:前沿模型能評斷美感嗎?

    10/8(四)Imperial Ballroom #35多模態 LM
  • BERT-as-a-Judge:高效參考式 LLM 評估中詞彙方法的穩健替代方案

    10/8(四)Imperial Ballroom #36評測
  • 評判、檢索,或棄權:具可證明風險保證的不確定性防護 LLM 評判

    10/8(四)Imperial Ballroom #37評測
  • 評分標準作為攻擊面:LLM 評審模型中隱匿的偏好漂移

    10/8(四)Imperial Ballroom #38評測
  • 大型語言模型基於評分標準評估中的自我偏好偏誤

    10/8(四)Imperial Ballroom #39評測
  • 比較開發者與 LLM 在程式碼評估中的偏誤

    10/8(四)Imperial Ballroom #40評測
  • 追逐公開分數:程式設計代理工作流程中的使用者壓力與評估漏洞利用

    10/8(四)Imperial Ballroom #41評測
  • 代理心理計量學:代理式程式設計基準測試中的任務層級效能預測

    10/8(四)Imperial Ballroom #42評測
  • SWE-Bench ProMax:在大規模多語言程式碼重構上對代理進行基準測試

    10/8(四)Imperial Ballroom #43工具與程式
  • 約束衰減:LLM 代理在後端程式碼生成中的脆弱性

    10/8(四)Imperial Ballroom #44工具與程式
  • 當正確的修補程式變得脆弱:對基於 LLM 的程式修復代理進行紅隊測試

    10/8(四)Imperial Ballroom #45安全
  • CREBench:評估大型語言模型在密碼學二進位逆向工程中的表現

    10/8(四)Imperial Ballroom #46安全
  • FinHardBench:LLM 能為金融運算生成具延遲意識的硬體嗎?

    10/8(四)Imperial Ballroom #47多元領域與新應用
  • AutoOR:可擴展地對 LLM 進行後訓練以自動形式化作業研究問題

    10/8(四)Imperial Ballroom #48多元領域與新應用
  • Routesplain:邁向針對軟體相關任務之忠實且可介入的路由機制

    10/8(四)Imperial Ballroom #49工具與程式
  • SkillRouter:大規模 LLM 代理的技能路由

    10/8(四)Imperial Ballroom #50工具與程式
  • 代理式技能在真實世界中的表現如何:於真實情境中對 LLM 技能使用進行基準測試

    10/8(四)Imperial Ballroom #51工具與程式
  • EvoSkill:多代理系統的自動化技能探索

    10/8(四)Imperial Ballroom #52工具與程式
  • FlowEvo:透過工作流程與可執行技能的共同演化實現自我演化代理

    10/8(四)Imperial Ballroom #53工具與程式
  • Dr. Zero:無需訓練資料的自我演化搜尋代理

    10/8(四)Imperial Ballroom #54工具與程式
  • AERO:透過內生雙迴路回饋實現自主演化推理最佳化

    10/8(四)Imperial Ballroom #55訓練
  • 透過自主演化進行神經架構探索

    10/8(四)Imperial Ballroom #56學習演算法
  • CORAL:邁向開放式探索的自主多代理演化

    10/8(四)Imperial Ballroom #57LM 與互動
  • EvoX:用於自動化探索的元演化

    10/8(四)Imperial Ballroom #58學習演算法
  • EvoLen:用於 DNA 語言模型的演化引導式分詞

    10/8(四)Imperial Ballroom #59多元領域與新應用
  • Struc-EMB:語言嵌入中結構感知編碼的潛力

    10/8(四)Imperial Ballroom #60學習演算法
  • 崩潰之前的結構:下一個 token 預測中的暫態語意幾何

    10/8(四)Imperial Ballroom #61語言模型科學
  • 為何你的提示壓縮器刪錯了 token:一項資訊理論的診斷

    10/8(四)Imperial Ballroom #62高效運算
  • 理解 LLM 免訓練低秩壓縮中的校準與截斷誤差傳播

    10/8(四)Imperial Ballroom #63高效運算
  • CeRA:透過在推論時保留非線性,突破低秩適應的線性天花板

    10/8(四)Imperial Ballroom #64高效運算
  • LLM 中的超級權重與選擇性訓練的失敗

    10/8(四)Imperial Ballroom #65語言模型科學
  • 在專家混合模型微調中保留長尾專家資訊

    10/8(四)Imperial Ballroom #66學習演算法
  • SlimQwen:探索大型 MoE 模型預訓練中的修剪與蒸餾

    10/8(四)Imperial Ballroom #67高效運算
  • 直接多 token 解碼

    10/8(四)Imperial Ballroom #68高效運算
  • 以區塊擴散草稿樹加速推測解碼

    10/8(四)Imperial Ballroom #69高效運算
  • FlexSQL:靈活的探索與執行造就更佳的文字轉 SQL 代理

    10/8(四)Imperial Ballroom #70工具與程式
  • BiomedSQL:針對生醫知識庫科學推理的文字轉 SQL

    10/8(四)Imperial Ballroom #71多元領域與新應用
  • DeepScholar-Bench:用於自動化評估生成式研究綜整的即時基準測試

    10/8(四)Imperial Ballroom #72評測
  • WebReal:針對真實世界使用者資訊需求對深度搜尋代理進行基準測試

    10/8(四)Imperial Ballroom #73評測
  • 邁向以人物誌模擬真實世界使用者、實現使用者中心功能涵蓋的全面行動應用程式測試

    10/8(四)Franciscan A #74工具與程式
  • CocoaBench:在真實世界中評估統一數位代理

    10/8(四)Franciscan A #75評測
  • AlphaEval:在生產環境中評估代理

    10/8(四)Franciscan A #76評測
  • ClawsBench:在模擬工作空間中評估 LLM 生產力代理的能力與安全性

    10/8(四)Franciscan A #77安全
  • ATBench:用於安全評估與診斷的多樣化真實代理軌跡基準測試

    10/8(四)Franciscan A #78安全
  • PM-Bench:評估 LLM 代理的前瞻記憶

    10/8(四)Franciscan A #79評測
  • AgentWorld:多代理 LLM 長時程協作的基準測試

    10/8(四)Franciscan A #80LM 與互動
  • MT-PINGEVAL:以私有資訊賽局評估多輪協作

    10/8(四)Franciscan B #81LM 與互動
  • AI 協助降低堅持度並損害獨立表現

    10/8(四)Franciscan B #82LM 與互動
  • 將 LLM 的假設語言化,以解釋並控制阿諛奉承行為

    10/8(四)Franciscan B #83安全
  • LLM 代理能有所發現嗎?在機器學習工程任務上評估創造力

    10/8(四)Franciscan B #84評測
  • 用於訓練機器學習工程代理的合成沙盒

    10/8(四)Franciscan B #85訓練
  • TritonRL:訓練 LLM 誠實地思考並撰寫 Triton 程式碼

    10/8(四)Franciscan B #86工具與程式
  • Quasar:一種專為 LLM 程式碼行動設計的程式語言

    10/8(四)Franciscan B #87工具與程式
  • MetaLint:程式碼風格檢查(linting)中從易到難的泛化能力

    10/8(四)Franciscan B #88工具與程式
  • MAPLE:以中繼資料增強的私有語言演化

    10/8(四)Franciscan B #89資料
  • PolicyLong:邁向同策略的情境延伸

    10/8(四)Franciscan B #90資料
  • 反思式情境學習:探討情境空間的最佳化原語

    10/8(四)Franciscan C #91訓練
  • 喚醒沉睡的代理:Lean 特定的代理資料重新啟動 Goedel Prover 中的通用工具使用能力

    10/8(四)Franciscan C #92學習演算法
  • 在自動研究代理中回收浪費的運算資源

    10/8(四)Franciscan C #93高效運算
  • 花得少、擬合得更好:透過主動實驗選擇實現預算高效的縮放律擬合

    10/8(四)Franciscan C #94語言模型科學
  • 資料受限訓練的規範性縮放律

    10/8(四)Franciscan C #95語言模型科學
  • 微調者的謬誤:何時該用你的微調資料進行預訓練

    10/8(四)Franciscan C #96資料
  • 領域感知縮放律揭示資料綜效

    10/8(四)Franciscan C #97語言模型科學
  • 透過因果表徵學習,發掘語言模型的階層式潛在能力

    10/8(四)Franciscan C #98語言模型科學
  • 語言模型是否始終如一地編碼「當前年份」?

    10/8(四)Franciscan C #99語言模型科學
  • 探討狀態空間模型中文件的「可融合性(soupability)」

    10/8(四)Franciscan C #100學習演算法
  • 訊息傳遞(Message Passing)實現高效推理

    ORAL10/8(四)Grand Ballroom #101高效運算
  • 以改裝後的遞迴機制,教導預訓練語言模型進行更深層的思考

    10/8(四)Grand Ballroom #102學習演算法
  • 解構 RoPE 的表達能力

    10/8(四)Grand Ballroom #103學習演算法
  • 向補語連詞致敬:Transformer 語言模型中句法結構的間接路由

    10/8(四)Grand Ballroom #104語言模型科學
  • 透過「恆等橋」(Identity Bridge)揭示 Transformer 中多跳推理的機制

    10/8(四)Grand Ballroom #105語言模型科學
  • KAMR:透過知識對齊的多跳檢索,為生成內容提供依據

    10/8(四)Grand Ballroom #106LM 與世界
  • CLaRa:以連續潛在推理銜接檢索與生成

    10/8(四)Grand Ballroom #107LM 與世界
  • SimulRAG:以模擬器為基礎的 RAG,為長篇科學問答中的 LLM 提供依據

    10/8(四)Grand Ballroom #108LM 與世界
  • Private-RAG:以 LLM 回答多重查詢,同時確保資料的差分隱私

    10/8(四)Grand Ballroom #109安全
  • 評估大型語言模型的檢索穩健性

    10/8(四)Grand Ballroom #110評測
  • 自我生成文本辨識:LLM 評估中的品質捷思、跨任務遷移與下游偏誤

    10/8(四)Grand Ballroom #111評測
  • QualAlign:針對人類編碼架構,為自動化質性編碼(qualitative coding)建立基準

    10/8(四)Grand Ballroom #112評測
  • 社會情境如何形塑大型語言模型輸出中與價值觀相關的內容

    10/8(四)Grand Ballroom #113心智、大腦、哲學、法律
  • LLM 在經濟因果推理中的意識形態偏誤

    10/8(四)Grand Ballroom #114LM 與世界
  • 虛幻真相效應,抑或僅是單純曝光效應?以 LLM 為基礎的社群媒體模擬中,因模型而異的重複效應

    10/8(四)Grand Ballroom #115LM 與世界
  • 大型語言模型中生成式廣告的誘因感知多保真度最佳化

    10/8(四)Grand Ballroom #116LM 與世界
  • SoftmaxGRPO:運用 Softmax 優勢群組估計學習推理

    10/8(四)Grand Ballroom #117訓練
  • 從失敗中學習:以可驗證獎勵進行修正導向的策略最佳化

    10/8(四)Grand Ballroom #118訓練
  • CURV:透過課程式視覺根據推理,強化圖表理解能力

    10/8(四)Grand Ballroom #119多模態 LM
  • 醫療視覺問答中的過度自信與校準:實證發現與幻覺感知緩解策略

    10/8(四)Grand Ballroom #120多元領域與新應用
  • 你的 logits 知道些什麼?

    10/8(四)Grand Ballroom #121語言模型科學
  • Attr-Kit:一套高效的免解碼(No-Decode)來源歸因工具套件

    10/8(四)Grand Ballroom #122語言模型科學
  • Pando:當模型拒絕自我解釋時,可解釋性方法是否仍然有效?

    10/8(四)Grand Ballroom #123語言模型科學
  • 當剪枝(Pruning)遇上可解釋性:在 LLM 中保留稀疏自編碼器的穩健性

    10/8(四)Grand Ballroom #124語言模型科學
  • 從保留-遺忘損失地景交互作用的視角,探討抗量化的遺忘學習

    10/8(四)Grand Ballroom #125學習演算法
  • 從開放權重語言模型中萃取(受著作權保護)書籍的記憶片段

    ORAL10/8(四)Grand Ballroom #126安全
  • 這個模型是誰打造的?透過權重空間中的頻譜指紋追溯 LLM 血統

    10/8(四)Grand Ballroom #127安全
  • 超越黑箱模糊化:白箱監控器的機制分析與防禦

    10/8(四)Grand Ballroom #128安全
  • 在大量代理軌跡中偵測安全違規行為

    10/8(四)Grand Ballroom #129安全
  • 訓練代理自我通報不當行為

    10/8(四)Grand Ballroom #130安全
  • 一次下毒,永久利用:針對網頁代理的環境注入式記憶下毒攻擊

    10/8(四)Grand Ballroom #131安全
  • BrowseSafe:理解並偵測 AI 瀏覽器代理中的提示注入

    10/8(四)Grand Ballroom #132安全
  • CPInj:揭露文字型協作提示最佳化中的提示注入風險

    10/8(四)Grand Ballroom #133安全
  • 延伸至現實:3D 環境中的提示注入

    10/8(四)Grand Ballroom #134安全
  • 透過語義等價的對抗性攻擊,引出 LLM 的內在幻覺

    10/8(四)Grand Ballroom #135安全
  • 當大型語言模型「認識」這張表:一套評估表格資料集中資料污染的框架

    10/8(四)Grand Ballroom #136評測
  • TRUST:一套用於審計大型語言模型推理的群眾外包框架

    10/8(四)Grand Ballroom #137評測
  • 在真實情境下審計內容審核的穩健性

    10/8(四)Grand Ballroom #138安全
  • 回歸基本:重新審視語音代理時代的自動語音辨識

    10/8(四)Grand Ballroom #139多模態 LM
  • SocialVeil:在溝通障礙下探測語言代理的社會智能

    10/8(四)Grand Ballroom #140LM 與互動
  • 無用但安全?在多輪對話中以使用者意圖釐清為基準,評估實用性恢復能力

    10/8(四)Grand Ballroom #141安全
  • 盲目拒絕:語言模型拒絕協助使用者規避不公、荒謬與不正當的規則

    10/8(四)Grand Ballroom #142安全
  • 當提示相互作用:評估提示算術在分布偏移下的去混淆能力

    10/8(四)Grand Ballroom #143訓練
  • 對齊打地鼠:微調會啟動大型語言模型對受著作權保護書籍的逐字回憶

    ORAL10/8(四)Grand Ballroom #144安全
  • 迷失於干擾之中:LLM 規劃代理在情境雜訊下能辨識卻無法運用相關資訊

    10/8(四)Imperial Ballroom #1推論演算法
  • 藏於稻草堆中:較小的針對 LLM 而言更難尋獲

    10/8(四)Imperial Ballroom #2評測
  • 基礎中的裂縫:看似微小的架構選擇如何影響長情境延伸

    10/8(四)Imperial Ballroom #3學習演算法
  • Gecko:一種能內在處理任意長度序列的高效神經架構

    10/8(四)Imperial Ballroom #4學習演算法
  • MS-GLA:透過多時間解析度,解決表徵瓶頸問題的多尺度門控線性注意力

    10/8(四)Imperial Ballroom #5學習演算法
  • DepthSSD:透過深度軸上的狀態空間模型重新思考殘差連接

    10/8(四)Imperial Ballroom #6學習演算法
  • MomentKV:彌合長情境推論中 KV 快取淘汰的方向性落差

    10/8(四)Imperial Ballroom #7高效運算
  • ASPIRE:用於長上下文 LLM 推論的非同步批次自我推測解碼

    10/8(四)Imperial Ballroom #8推論演算法
  • SPEED:用於高效推測解碼的專門位置專家

    10/8(四)Imperial Ballroom #9推論演算法
  • Goose:用於免訓練推測解碼的非等向性推測樹

    10/8(四)Imperial Ballroom #10推論演算法
  • 大型語言模型的統計無損量化

    10/8(四)Imperial Ballroom #11高效運算
  • NIRVANA:重新構思大型語言模型壓縮的結構化剪枝

    10/8(四)Imperial Ballroom #12高效運算
  • OPERA:用於高效檢索模型調適的線上資料剪枝

    10/8(四)Imperial Ballroom #13高效運算
  • 透過基數限制二元二次規劃實現原則性且可擴展的多樣性感知檢索

    10/8(四)Imperial Ballroom #14LM 與世界
  • Jagle:為視覺語言模型建構大規模日語多模態後訓練資料集

    10/8(四)Imperial Ballroom #15資料
  • Opusanimation:基於程式碼的動態圖表生成

    10/8(四)Imperial Ballroom #16多模態 LM
  • Co-Director:代理式生成影片敘事

    10/8(四)Imperial Ballroom #17多模態 LM
  • 透過多模態 LLM 學習人類對 AI 生成影片之「假造感」的感知

    10/8(四)Imperial Ballroom #18多模態 LM
  • 以梯度指紋偵測並抑制獎勵駭客行為

    10/8(四)Imperial Ballroom #19訓練
  • Voice of Reason:用於口語數學的強化學習

    10/8(四)Imperial Ballroom #20多模態 LM
  • 驗證數學證明是否需要前沿模型?

    10/8(四)Imperial Ballroom #21推論演算法
  • Ill-Defined Math:超越良定義問題的 LLM 推理基準測試

    10/8(四)Imperial Ballroom #22評測
  • 具元認知回饋的強化學習可誘發 LLM 忠實表達不確定性

    10/8(四)Imperial Ballroom #23訓練
  • GRADE:透過梯度子空間動態探測 LLM 的知識缺口

    10/8(四)Imperial Ballroom #24語言模型科學
  • LLM 中的文法「祖母神經元」十分罕見

    10/8(四)Imperial Ballroom #25語言模型科學
  • 詞彙嵌入在語言模型訓練早期即組織出語言結構

    10/8(四)Imperial Ballroom #26語言模型科學
  • 迷失在反向傳播中:語言模型輸出層是梯度瓶頸

    10/8(四)Imperial Ballroom #27大型 LM 工程
  • BidirLM:透過調適與組合因果 LLM,從文字打造全模態雙向編碼器

    10/8(四)Imperial Ballroom #28多模態 LM
  • REFRAMED:邁向電影的真實情境音訊描述生成

    10/8(四)Imperial Ballroom #29多模態 LM
  • TIDES:用於建模多方社會動態的縱貫式雙語資料集

    10/8(四)Imperial Ballroom #30LM 與互動
  • MoltNet:理解代理原生平台 MoltBook 中 AI 代理的社會行為

    10/8(四)Imperial Ballroom #31LM 與互動
  • CooperBench:為何程式碼代理尚無法成為你的隊友

    10/8(四)Imperial Ballroom #32LM 與互動
  • 人格組成在何時對多代理 LLM 團隊具有影響?

    10/8(四)Imperial Ballroom #33LM 與互動
  • 高波動性與行動偏誤:群體協調中 LLM 與人類的區別

    10/8(四)Imperial Ballroom #34LM 與互動
  • 誘發情緒是否會使 LLM 在序列決策中的行為產生偏誤?

    10/8(四)Imperial Ballroom #35心智、大腦、哲學、法律
  • AI 聊天機器人中的廣告?大型語言模型如何應對利益衝突之分析

    10/8(四)Imperial Ballroom #36心智、大腦、哲學、法律
  • 「微觀決策不是我做的」:衡量、誘發並揭露協作中目標層級的 AI 貢獻

    10/8(四)Imperial Ballroom #37LM 與互動
  • CCBench:透過健康查詢中隱性傳達的規範評估 LLM 的文化能力

    10/8(四)Imperial Ballroom #38普惠 LM
  • 情境內行為評估:LLM 公平性評估不應仰賴標準化測驗分數

    10/8(四)Imperial Ballroom #39普惠 LM
  • RealUserSim:透過扎根式使用者模擬彌合代理基準測試中的現實落差

    10/8(四)Imperial Ballroom #40評測
  • ConsumerBench:終端使用者裝置上生成式 AI 應用的基準測試

    10/8(四)Imperial Ballroom #41大型 LM 工程
  • MolDesignBench:評估基於 LLM 之代理在情境扎根式分子設計中的表現

    10/8(四)Imperial Ballroom #42多元領域與新應用
  • RetroAgent:運用 LLM 在結構化記憶中搜尋以進行代理式逆合成規劃

    10/8(四)Imperial Ballroom #43多元領域與新應用
  • 程式碼代理能否重現計算材料科學中的研究發現?

    10/8(四)Imperial Ballroom #44多元領域與新應用
  • Stargazer:天文物理限制條件下 AI 代理的可擴展模型擬合基準測試環境

    10/8(四)Imperial Ballroom #45多元領域與新應用
  • Odysseys:在真實長時程任務上對網頁代理進行基準測試

    10/8(四)Imperial Ballroom #46工具與程式
  • 問題出在哪裡?以語意狀態追蹤對網頁代理進行過程層級評估

    10/8(四)Imperial Ballroom #47評測
  • Agent Alpha:透過樹狀搜尋統一生成、探索與評估,以發掘電腦操作解法

    10/8(四)Imperial Ballroom #48推論演算法
  • 具自我反思能力的元強化學習用於代理式搜尋

    10/8(四)Imperial Ballroom #49訓練
  • 循環一致性搜尋:以問題可重建性作為搜尋代理訓練的代理獎勵

    10/8(四)Imperial Ballroom #50訓練
  • OpenSeeker:透過完全開源訓練資料,推動前沿搜尋代理的普及化

    10/8(四)Imperial Ballroom #51資料
  • GraphWalker:透過合成軌跡課程實現代理式知識圖譜問答

    10/8(四)Imperial Ballroom #52LM 與世界
  • 透過 BREW 改善語言代理:自舉式經驗學習環境知識

    10/8(四)Imperial Ballroom #53工具與程式
  • TierMem:平衡壓縮記憶與原始證據,用於長時程代理記憶

    10/8(四)Imperial Ballroom #54工具與程式
  • 更簡短,但仍值得信賴?思維鏈壓縮的實證研究

    10/8(四)Imperial Ballroom #55高效運算
  • 無言之思:以抽象思維鏈實現高效潛在推理

    10/8(四)Imperial Ballroom #56高效運算
  • 碎片化思維鏈推理

    10/8(四)Imperial Ballroom #57推論演算法
  • 為何推理模型會喪失涵蓋範圍?資料與「岔路」所扮演的角色

    10/8(四)Imperial Ballroom #58訓練
  • 線上推理校準:測試時訓練實現可泛化的保形 LLM 推理

    10/8(四)Imperial Ballroom #59推論演算法
  • 被放大不代表具預測力:思考模型中的推理行為

    10/8(四)Imperial Ballroom #60評測
  • TRAPSBench:視覺語言模型編碼了知態克制,卻無法將其表達出來

    10/8(四)Imperial Ballroom #61多模態 LM
  • 聽見卻未留意:音訊語言模型中副語言資訊的編碼與流失

    10/8(四)Imperial Ballroom #62多模態 LM
  • OpenStamp:用於開源語言模型的浮水印

    10/8(四)Imperial Ballroom #63安全
  • 語意差異化:應對低熵限制生成輸出浮水印化的挑戰

    10/8(四)Imperial Ballroom #64安全
  • 人類與機器翻譯偵測:跨模型、跨領域與低資源分析

    10/8(四)Imperial Ballroom #65普惠 LM
  • We Hebben Een Serieus Translatie:將互通理解建模為機率推論

    10/8(四)Imperial Ballroom #66心智、大腦、哲學、法律
  • PromptNCE:僅使用 LLM 與對比估計提示求得條件機率與逐點互資訊

    10/8(四)Imperial Ballroom #67語言模型科學
  • 透過活化子空間理解加法的情境內學習

    10/8(四)Imperial Ballroom #69語言模型科學
  • 推理模型知道什麼重要,並將其編碼於活化值中

    10/8(四)Imperial Ballroom #70語言模型科學
  • Transformer 拒答機制中的元件與維度稀疏性

    10/8(四)Imperial Ballroom #71語言模型科學
  • Prism-Δ:大型語言模型提示凸顯的差異子空間導引

    10/8(四)Imperial Ballroom #72推論演算法
  • 子空間控制:將限制性模型導引轉化為可控的頻譜最佳化

    10/8(四)Imperial Ballroom #73學習演算法
  • 透過免資料共變異數估計實現模型合併

    10/8(四)Franciscan A #74學習演算法
  • 多目標演化式合併實現高效推理模型

    10/8(四)Franciscan A #75高效運算
  • ACEvo:用於組合最佳化的問題分布與求解器對抗式共同演化

    10/8(四)Franciscan A #76多元領域與新應用
  • 透過 LLM 引導的規則合成學習可重複使用的程式轉換

    10/8(四)Franciscan A #77工具與程式
  • 模型會建模,卻不會綁定:文字轉最佳化中的結構化扎根

    10/8(四)Franciscan A #78多元領域與新應用
  • 格式稅:區分「要求結構」與「強制結構」的成本

    10/8(四)Franciscan A #79推論演算法
  • 有句法而無語意:教導 LLM 以未見過的語言撰寫程式碼

    10/8(四)Franciscan A #80工具與程式
  • 透過資訊瓶頸打破 LLM 程式碼微調中的記憶障礙以提升泛化能力

    10/8(四)Franciscan B #81工具與程式
  • 分開訓練,合併使用:採用專家混合模型的模組化後訓練

    10/8(四)Franciscan B #82學習演算法
  • DR-LoRA:用於微調專家混合模型的動態秩 LoRA

    10/8(四)Franciscan B #83訓練
  • MoANT:具語意感知直覺的一階秩專家混合模型,用於多任務大型語言模型微調

    10/8(四)Franciscan B #84訓練
  • MoLGE:語言群組專家混合模型,用於大規模多語言語音辨識的高效擴展

    10/8(四)Franciscan B #85普惠 LM
  • Marco-MoE:透過高效升級改造打造的開放式多語言專家混合語言模型

    10/8(四)Franciscan B #86普惠 LM
  • PreMoE:面向高效專家混合模型的主動式推論

    10/8(四)Franciscan B #87高效運算
  • 路徑約束式專家混合模型

    10/8(四)Franciscan B #88學習演算法
  • 具動態運算分配與負載平衡的自迴歸語言建模專家閾值路由

    10/8(四)Franciscan B #89學習演算法
  • 專家選擇式路由實現擴散語言模型中的自適應運算

    10/8(四)Franciscan B #90學習演算法
  • TRIMS:面向擴散語言模型的軌跡排序指令遮罩監督

    10/8(四)Franciscan C #91學習演算法
  • 透過軌跡精煉實現擴散語言模型的推論時擴展

    10/8(四)Franciscan C #92推論演算法
  • MetaState:持久性工作記憶提升離散擴散語言模型的推理能力

    10/8(四)Franciscan C #93學習演算法
  • CritICL:從小型語言模型失敗模式實現推論時的弱到強泛化

    10/8(四)Franciscan C #94推論演算法
  • RefCritic:以精煉回饋訓練長思維鏈評論模型

    10/8(四)Franciscan C #95訓練
  • Autorubric:針對不可驗證任務的基於評分標準之 LLM 評估統一框架

    10/8(四)Franciscan C #96評測
  • 利用直接偏好最佳化緩解 LLM 對虛假社會情境的偏差

    10/8(四)Franciscan C #97普惠 LM
  • WorldPM:透過真實世界回饋擴展人類偏好建模

    10/8(四)Franciscan C #98訓練
  • 超越專家使用者:代理應協助使用者建構偏好,而非僅止於引出偏好

    10/8(四)Franciscan C #99LM 與互動
  • 將不確定性作為規劃訊號:面向目標導向對話的多輪決策制定

    10/8(四)Franciscan C #100LM 與互動
  • LLM 在創意寫作中展現的不確定性顯著低於專業作家

    10/8(四)Grand Ballroom #101語言模型科學
  • 語言模型或許並不理解你:透過故事提示評估心智理論

    10/8(四)Grand Ballroom #102心智、大腦、哲學、法律
  • 深入學生的思維:在 LLM 學生模擬器中聯合建模潛在推理與行動

    10/8(四)Grand Ballroom #103多元領域與新應用
  • HPFA:面向 LLM 推理的基於超圖之成對失敗歸因

    10/8(四)Grand Ballroom #104推論演算法
  • 是誰弄壞了系統?基於 LLM 的多代理系統中的失敗定位

    10/8(四)Grand Ballroom #105LM 與互動
  • Agent Q-Mix:透過強化學習為 LLM 多代理系統選擇正確行動

    10/8(四)Grand Ballroom #106LM 與互動
  • 透過輪次層級重要性取樣與裁剪觸發正規化,穩定長期 LLM 代理的離策略訓練

    10/8(四)Grand Ballroom #107訓練
  • 邁向 LLM 的全流程 FP8 強化學習

    10/8(四)Grand Ballroom #108高效運算
  • 透過拉格朗日獎勵增強實現安全的推論時對齊

    10/8(四)Grand Ballroom #109安全
  • RL-VLA^3:面向視覺-語言-行動(VLA)訓練的靈活非同步強化學習框架

    10/8(四)Grand Ballroom #110LM 與具身
  • 隨推理展開而學習:面向高效強化學習的漸進式 Rollout 分配

    10/8(四)Grand Ballroom #111訓練
  • ExpRL:面向 LLM 中期訓練的探索式強化學習

    10/8(四)Grand Ballroom #112訓練
  • 多樣性還是精確度?深入探討下一個 token 預測

    ORAL10/8(四)Grand Ballroom #113語言模型科學
  • Se-DPO:面向直接偏好最佳化的自我演化 Token 信用度

    10/8(四)Grand Ballroom #114訓練
  • Token 層級控制,還是僅僅是更好的平均值?區隔自適應解碼的效益來源

    10/8(四)Grand Ballroom #115推論演算法
  • 無權重微調:透過 Logit 空間傳輸實現 LLM 個人化

    10/8(四)Grand Ballroom #116LM 與互動
  • 課程學習即傳輸:透過 Wasserstein 測地線理解課程設計

    10/8(四)Grand Ballroom #117訓練
  • 透過模態連通性視角理解機器遺忘學習

    10/8(四)Grand Ballroom #118學習演算法
  • 論機器遺忘學習中「重訓等價性」的不可能性

    10/8(四)Grand Ballroom #119學習演算法
  • LACUNA:評估 LLM 遺忘學習定位精確度的測試平台

    10/8(四)Grand Ballroom #120學習演算法
  • MoRFI:單調稀疏自編碼器特徵識別

    10/8(四)Grand Ballroom #122語言模型科學
  • UNMASK:發現並因果驗證文本分類器中的虛假捷徑

    10/8(四)Grand Ballroom #123語言模型科學
  • 基準測試設計者應「在測試集上訓練」,以揭露可被利用的非視覺捷徑

    10/8(四)Grand Ballroom #124評測
  • TemMed-Bench:評估視覺-語言模型中的時序醫學影像推理能力

    10/8(四)Grand Ballroom #125多元領域與新應用
  • CARV:多模態 LLM 組合式類比推理的診斷性基準測試

    10/8(四)Grand Ballroom #126多模態 LM
  • Percept-V 挑戰:多模態 LLM 能破解簡單的知覺問題嗎?

    10/8(四)Grand Ballroom #127多模態 LM
  • Pixel-SAIL:用於像素級基礎理解的單一 Transformer

    10/8(四)Grand Ballroom #128多模態 LM
  • CoVLA:以更少視覺 Token 實現視覺-語言對齊

    10/8(四)Grand Ballroom #129多模態 LM
  • EvoSelect:面向目標任務適配的資料高效 LLM 演化

    10/8(四)Grand Ballroom #130資料
  • 教導 LLM 自我演化:以強化學習培養核心後設技能

    10/8(四)Grand Ballroom #131訓練
  • EvoSkillBank:面向代理持續學習的階層式技能自我演化與技能庫治理

    10/8(四)Grand Ballroom #132學習演算法
  • 邁向透過技能圖實現可擴展的終端任務合成

    10/8(四)Grand Ballroom #133工具與程式
  • 預算感知工具使用實現有效的代理擴展

    10/8(四)Grand Ballroom #134工具與程式
  • 面向推理的思維層級集束搜尋

    10/8(四)Grand Ballroom #135高效運算
  • TRACES:標記推理步驟以實現自適應、具成本效益的提前停止

    10/8(四)Grand Ballroom #136高效運算
  • HarmThoughts:推理軌跡中細粒度有害行為偵測基準測試

    10/8(四)Grand Ballroom #137安全
  • TrailBlazer:歷史引導的強化學習用於黑箱 LLM 越獄

    10/8(四)Grand Ballroom #138安全
  • 有本事就攻破我:透過詞彙插入提示對已對齊 LLM 進行自我越獄

    10/8(四)Grand Ballroom #139安全
  • PISmith:基於強化學習的紅隊測試,用於評估提示注入防禦

    10/8(四)Grand Ballroom #140安全
  • 對抗間接提示注入的改善穩健性可內建於 LLM 之中

    10/8(四)Grand Ballroom #141安全
  • 針對大型推理模型的干擾項注入攻擊:特性刻劃與防禦

    10/8(四)Grand Ballroom #142安全
  • MEMENTO:教導 LLM 管理自身的情境脈絡

    ORAL10/8(四)Grand Ballroom #143高效運算
  • AI 基準測試究竟在衡量什麼:運用聚合效度與區辨效度檢視 56 個 AI 基準測試

    ORAL10/8(四)Grand Ballroom #144評測
  • 內省式擴散語言模型

    ORAL10/8(四)Grand Ballroom #145學習演算法
<!-- ==== Scripts (order matters:shell → data → page)==== -->