顯示具有 機器學習與深度學習 標籤的文章。 顯示所有文章
顯示具有 機器學習與深度學習 標籤的文章。 顯示所有文章

星期一, 11月 10, 2025

論文閱讀:Free Transformer

Arxiv 連結

來記錄一下最近在 GPT 幫助下讀過的最難的 paper:Free Transformer。這篇的數學難到撞牆。

這篇核心概念,就是在 Transformer 裡面明確在模型裡顯式引入潛變量 Z。(論文 Z 不是單一全局變數而是序列 Z1...ZT)


 

在原本 Transformer 結構,潛變量 Z (例如影片是正評、負評)是通過學習序列預測來進行隱式學習。這種方法存在幾個缺點。首先,要計算我們感興趣的變量 Z,會涉及很複雜的計算,並且這類計算容易出錯。只要序列生成中出現錯誤,整個序列以及根據該序列推導出的 Z 都會是錯誤的。此外,沒有顯式表達 Z,把產生 Z 建立在序列預測,也可能在新資料因為序列預測表現不同而影響泛化,這也是論文 (1)(2) 式舉例想表達的。


另一個難點是論文中 (3)。這個(3)邊際似然(marginal likelyhood)P(S)和論文中 loss function 有關,loss function 其中一部分近似 logP(S) 的證據下界(ELBO),因此當 loss 降低時,意謂 ELBO 提高,從而提高對 logP(S) 的下界。而 P(S) 基本上可以看作在先驗 P(Z) 下對 P(S|Z) 的期望。如果P(S)夠高,那麼在模型生成的過程中,只要採樣Z,就會有足夠的機會讓模型產生的 S' 能夠對應到真實的序列 S。而 Z1...ZT 並非參數,是隨機採樣出來的,編碼器參數(確定 Q)與解碼器參數(確定 P(S|Z))才是需要學的。


接下來難點是所謂 free bit 設計。Free bit 目的在於避免 KL collapse ,也就是,VAE decoder 以及後面的模型直接將採樣的 Z 丟棄不用,然後 VAE 訓練出的分佈 Q(Z|S) 直接套先驗分佈,然後 KL Loss 歸零成功最小化,但 VAE 就整個沒用。為了避免這種情況,模型引入了 free bit,使得 Q 分佈與先驗分佈之間可以允許一定程度差異,不會計入 Loss。

接下是所謂的 Binary Mapping。它的模組有一層,不是直接輸出 2^H 次方個 output,而是將輸出 H 個互相獨立的 Binary Bit,具體輸出 class number 則是這 H 個 bit 對應的 binary number。學習 H 個(例如 16 個)互相獨立的 binary classification 會比直接學 2^H 個 class(如 65536 個)訓練更好,降低參數量、避免大多數輸出都是在 0 附近微調,訓練速度慢並且容易被 noise 干擾,也避免資料不夠長尾類別學不到。


剩下的部分是實際測試。首先是 free bit 的設定。Kappa 太低,模型表現與正常 Transformer 相同,實際上就是 KL collapse,導致 VAE 沒有作用。然後,當 Kappa 的值過大,模型會在 Z 藏太多資訊,實際上是 overfitting,測試中連雜訊都學進去了。然後後面 benchmark 的部份就沒有細讀。更多的細節我看不懂 XD





全文連結

星期一, 10月 20, 2025

讀論文:Less is More: Recursive Reasoning with Tiny Networks

連結

這篇論文挺有趣,裡面提到的 HMM 和 TRM 架構,讓我想到 RNN 。不過在RNN中,Recurrent 是讓 latent space 隨時間演化,最後 prediction 才參考一次 gold label 進行 BPTT,而這篇文章中的 TRM 每次遞迴的大步(deep supervision)都維護「當前答案 y」與「推理潛變數 z」並參考 training gold label 進行更新 z 修正 y。

全文連結

星期三, 3月 26, 2025

資源:大隊長手把手帶你發論文

連結

最近 B 站刷到最有用的資源,作者廣泛閱讀大量論文、將重要模型架構拆解成模組,每個模組附上講解甚至改善的思路,再加上精簡的 PyTorch 源始碼,只賣 199 人民幣,正適合我小白入門,反正我是買了 :P 對岸研究生真的捲到爆炸 orz

全文連結

星期一, 8月 05, 2024

星期三, 7月 31, 2024

影片:不要浪費錢買課了,喂飯式教你訓練大模型llama3

連結

今天無意間逛到的影片,介紹和示範了 finetune LLM 的方法,如 LORA、QLORA 和 quantization,並簡介了多種訓練、佈署、應用本地 LLM 有關的工具。包括 Unsloth、Torchtune、llama.cpp、LM Studio。

中文 llama 用弱智吧訓練效果竟然比正經的百科好也真神奇 XD

全文連結

星期三, 7月 03, 2024

Doccano docker-compose 檔

Doccano 是我標注 NLP 訓練資料經常用的軟體(咦你不是只有一篇嗎?)。官網教學詳細,但沒有 docker-compose.yml。其實照著官網教學,加上自己補細節就很容易生出來

version: '3'

services:
  doccano:
    image: doccano/doccano
    container_name: doccano
    ports:
      - "8000:8000"
    environment:
      - ADMIN_USERNAME=xxx
      - ADMIN_EMAIL=xxx
      - ADMIN_PASSWORD=xxx
    volumes:
      - ${PWD}/data:/data


指定 container_name 是為了方便下指令,ADMIN_USERNAME、ADMIN_EMAIL、ADMIN_PASSWORD 作用明顯。指定 volumes 是讓 container 關掉後標注的資不會不見(!),不過我個人還是每一段進度就全部匯出存 git 安心點。

全文連結

星期六, 5月 11, 2024

星期五, 5月 10, 2024

Probabilistic Machine Learning -- Philipp Hennig, 2023

Youtube 播放清單
投影片

好課,把 ML/DL 會用到的機率知識整合起來,而且深度非常夠。

現在坊間「AI 背後的數學」課和書籍不少,但大多數太淺,例如微積分可能就講到 chain rule。對於看 paper 來說完全不夠用,課本和 cutting edge research 有巨大落差。直奔數學系的課,內容又太多不知從何學起,像本座高等微積分現在才換了老師剛看到收斂數列的性質,初微、線代課看完了現在習題都沒做 XDDD 課程還提供投影片讓人自習。非常慷慨。

原本是 B 站上看的,但 B 站沒搬運到最新的版本,且字幕不全,就去 Youtube 找最新完整版了。


全文連結

星期一, 4月 22, 2024

兩門 Computer Vision 課程

CS 198-126: Modern Computer Vision Fall 2022 (UC Berkeley)  

Computer Vision — Andreas Geiger 

紀錄下最近囤到的 CV 課,松鼠黨的收藏又增加了 XD

之前 B 站的 CS231 課也不錯,但只有 Justin Johnson 講的我聽的懂,Serana Yeung 在講什麼根本電波對不到。並且課程到後來速度越來越快,只能把一堆研究稍微帶過去,學到的東西很少。換別的課看手氣會不會好點 XD

全文連結

淺談 Prompt 自動最佳化工具

連結 

今天被介紹、推坑了 LLM prompt 最佳化的文章,文中帶出了很多 paper。粗看下來最優先需要了解的應該是 AutoPrompt,其對應 paper 如下:  

Intent-based Prompt Calibration: Enhancing prompt optimization with synthetic boundary cases 

其他 research 和 paper 乍看也不錯,但暫時沒有動力去看 Q<>Q 

最近要做 LLM 和 GPT 有關的 study,這算是及時雨 XD

全文連結

星期四, 4月 18, 2024

MedAI Session 20: Many Faces of Weak Supervision in Medical Representation Learning 觀後感

今天用用冗餘時間把 MedAI Session 20: Many Faces of Weak Supervision in Medical Representation Learning 看完一遍。感覺還是卡在同樣的地方,特別是如何用 noisy labeler 產生 probabilistic label 的部分,看來還是要繼續問 GPT 還有補數學。 

看的過程中,發現要看的 paper 也更多了。  

Data Programming: Creating Large Training Sets, Quickly 

 這篇也是講 Snorkel 的,但看來比之前看到那篇好懂一些。再努力看看  

Doubly Weak Supervision of Deep Learning Models for Head CT  

Cross-Modal Data Programming Enables Rapid Medical Machine Learning  

Multi-task weak supervision enables anatomically-resolved abnormality detection in whole-body FDG-PET/CT 

這三篇應該算重要收穫了。醫院放報告和影像一大堆,如果可以用報告加影像直接 train model 那做 deep learning 就會變得容易很多(謎之音:我也不用爆肝)。特別是有論文提到用 BERT 去把原始報告轉換成 study-level 的 label,現在有 LLM 可以用 few-shot 感覺這部份會容易很多。

全文連結

星期二, 4月 16, 2024

星期四, 4月 11, 2024

星期二, 4月 09, 2024

Mamba 架構介紹影片

【博士Vlog】2024最新模型Mamba详解,Transformer已死,你想知道的都在这里了

今天偶然看到的,號稱 transformer 殺手的 Mamba 架構。從影片看來,Mamba 優化了 transformer 的複雜度,並且更加考量到現有 GPU 架構,實現更快的推理,並且在實際應用上很多地方可以平滑的替代 transformer (謎之音:那些用 transformer 做過的 paper 可以全部再做一遍)。後面李飛飛大老的團隊 U-Mamba 實做 CT segmentation 擊中了我 Q<>Q 我連 transformer 都還沒全部弄明白呢,

先做個紀錄,也許以後可以發想一些 idea

全文連結

星期二, 3月 26, 2024

Theory & Systems for Weak Supervision by Christopher Re @MLSYS 2020


Snorkel Github
Practical Weak Supervision: Doing More With Less Data

這陣子為了 computer vision 還有 weakly supervised learning 的事情頭痛。要發 paper 需要 label 動輒破千的影像資料讓我快燒壞腦袋。

這應該是這陣子聽到最重要的 talk。重點在於 Snorkel 這個 project。相較於 supervised learning 要專家直接標資料,Snorkel 將問題從 data labeling 轉變成如何找出夠多的 weak labeling function,然後在目前我還沒搞懂的 labeling model 或投票機制作用之下,weakly supervised model 或 gold + silver label 的方法訓練出來的成果不會比專家爆肝差太多,但專家爆肝可能要一年才有辦法幾千份,labeling function 快的話只要幾天。

只是目前看到的 tutorial 都還在用 NLP 說明,還不知道怎麼做 weakly supervised object segmentation or detection。不過有 Oreilly 有出書整理,應該會比直接啃論文快些。

全文連結

星期二, 3月 19, 2024

Weakly supervised semantic segmentation for CNN

 我司最近忽然提起可以試著用醫學影像發 paper。但我完全是外行,從數學到模型到寫程式都需要自學,還沒有人標資料,差點把我嚇出心臟病。

CV 和之前玩 NLP 不同。NLP (至少我自己那篇)可以用 regex 或其他方法先弄出不那麼精確的 label 再人工校正,不需要真的從無到有通通自己標,但 CNN 至少我目前還不會這些方法。所以只好趕快去問網路。

目前找到一門課還有一份 slide 可以看。

ECCV 2020 WSL tutorial: 1. Introduction to the tutorial on Weakly Supervised Learning



Weakly Supervised CNN Segmentation: Models and Optimization
來源

不管會不會看,松鼠黨先屯了再說 XD

全文連結

星期一, 3月 18, 2024

李弘毅老師【機器學習 2023】(生成式 AI)課程

連結


又自學完一門 ChatGPT 的課程。面向大學生,應用類的。

內容比教 BERT 的課程淺顯很多,畢竟是面向 API 的。不過也可以作為不錯的基礎用來跑 data 寫 paper 了。

最後幫李弘毅的課點讚,內容比吳恩達老師的課豐富許多 XD

全文連結

星期五, 1月 19, 2024

Aladdin Persson

Aladdin Persson Youtube 頻道

紀錄一下一個 Deep Learning 大神的頻道。這是研究 Yolo V1 看到的。大神表演現場用 Pytorch 手打 YOLOV1 訓練、推理、程式碼。連 import library 都直接背。Linkin 看了一下果然是相關職業背景。職業強者果然不一樣 XD  

全文連結

星期三, 11月 29, 2023

斯坦福李飛飛 CS231n 計算機視覺課程

連結

記錄一下最新上完的課,奔著 Stanford 大學的名字去的。不過有點失望,課程有點虎頭蛇尾。前面講深度學習基礎的部分還可以,講的深入淺出,但從 RNN 以後的課基本上就不行,都是帶一堆 paper,然後每個重要 work 抓幾個沒頭沒尾的公式出來講,都聽不大懂,抓不到 intuition。特別是其中還有一位講者,講得非常混,ppt 念稿大師,重要內容含糊帶過,觀眾在彈幕一致吐槽。

課程最後一集來賓演講就非常好,第一位華人講者 Song Han 大神分享很多深度學習優化乾貨,訓練、推論、軟體、硬體都具體而微帶過了,第二位來賓是 Goodfellow 大神,講 Adversarial Attack,不過後半部就講得比較深聽不懂。

感覺還是得乖乖念 paper QQ




全文連結

星期五, 10月 13, 2023

Open Pretrained Transformers - Susan Zhang | Stanford MLSys #77

 乾貨很多的好影片。內容主要是訓練大模型踩過的各種坑,模型大了什麼鬼問題都有,從顯示卡、CUDA、記憶體等設備直接出包,到到各種莫名其妙的 convergence failure,原因查得到和查不到的都有。遇到問題的各種解法,包括看paper有理論基礎的,還有憑經驗通靈的都有 XD

訓練大模型的經驗不是每個人都有機會接觸的,至少我周圍環境最多就根據任務 finetune。更別提把經驗用非常直白的方式講出來,未來訓練模型的話應該可以參考 XD

全文連結