合集·手撕“Everything”系列,Transformer, Diffusion, LLM等
逛網路看到的好資源,分別是手算和土炮類神經網路。以後要扛 AI 研發任務的話還是要有基本功好,松鼠黨的收藏又增加了 XD
全文連結逛網路看到的好資源,分別是手算和土炮類神經網路。以後要扛 AI 研發任務的話還是要有基本功好,松鼠黨的收藏又增加了 XD
全文連結GPT-4 真是讀 paper 神器。
以 Training Complex Models with Multi-Task Weak Supervision 這篇為例,中間小節開始引入集合操作符號就開始看不懂。靠自學 PR 值 < 0.1 的線性代數和數學符號認知,也完全看不懂抽象化後的 Material and Method。
交給 GPT-4 奇蹟出現。先用 LaTeX 把數學公式還原好,再整段丟進去,然後不管 GPT-4 回什麼,直接問 can you give me concrete example?,GPT 就直接解了抽象化,用非常簡單的例子就知道這段大概在講啥,過程中順便釐清我對大量符號的誤解,還有我對圖論基本名詞的認知錯誤。
看來 GPT-4 可以當成讀跨領域 paper 神器,效果遠勝我門外漢亂猜,前提是問題要問對。例如從 paper pdf 複製文字提問時,要用 LaTeX 把被破壞的格式還原 GPT 才知道你在講什麼
不曉得是不是 weakly supervised learning 這個主題 GPT 看過的文本夠多,才有這麼好的效果?可能要讀更多 paper 才能驗證。
在找尋 Weakly supervised learning 的時候挖到的。我想看的是這個:MedAI Session 20: Many Faces of Weak Supervision in Medical Representation Learning | Jared Dunnmon
感覺根本就是 cutting-edge 寶藏海,挖 paper 題目就靠這些寶貝了 QQ
全文連結改自本座拙著,最近 iwin 管制虛擬「兒童色情」和真實兒少性剝削鬧得沸沸揚揚。本座屬於「嚴打真實戀童,但反對同等嚴打虛擬人物」流派。
本座認為首先該做還是「正名」
愛看電影殺人情節,但反對現實殺人的人不叫「潛在殺人犯」,哪怕他喜歡的電影殺人情節可以非常血腥讓人不舒服吐出來,跟真正的潛在殺人犯還是不同。
同理,只看二次元,但反對現實戀童的宅宅也不等於「戀童」。就算某肥宅真的看了很噁心的本子,只要該肥宅堅定反對侵害真人,那就不能跟真正的戀童癖混淆。
本座認為這一定要說清楚。如果 ACG 愛好者和肥宅們認為自己算戀童,只是屬於虛擬沒那麼嚴重 etc. 那先天就站在道德劣勢,你已經承認了自己有病,那保守派嚴刑峻法對付你幫你把病醫好不好嗎?
依據母法的定義、從法明確性來看,法律上的「人」就只能是自然人,否則就是重新定義人類,這點不細說。
國外規範虛擬色情的法律,會用 non-genuine sexual acts with minors(瑞士 Swiss Criminal Code)image of an imaginary child(英國 Coroners and Justice Act 2009)等詞彙,明文表示虛擬人物也屬於刑法的規制對象,這也佐證在刑法上,「虛擬人物」和「人」並不是相同概念,否則何須吃飽沒事幹換個詞明文表示?
反觀台灣,相關條文都是規範兒少的圖畫 etc. 條文從未明示將虛擬人物也納入管理,因此衛服部和 iwin 說虛擬人物也屬於兒少性剝削,純屬擴張解釋法律,顯不符立法原意。
大法官釋 617 同理,本座主張釋 617 規定人獸交屬硬核,其「人」僅限定於自然人。大法官從未在任何解釋將「人」的定義擴展到虛擬人物(大概也沒想到會有邏輯鬼才把虛擬人物也當人)。所以別再說二次元作品有可能觸犯釋 617 的人獸交了,頂多算軟芯猥褻物而已。否則當這麼說的時候你已經無形接受了「虛擬人物也是人」的錯誤概念,從而在接下來輿論戰失利。
最近有幸終於投中一篇小社論。本座以為在目前這個風口,「打 ACG 是浪費貴重預算」是能被接受的。
日本 ACG 發達但性犯罪率遠低歐美。目前台灣無二次元導致兒少受害案件,兒少受害案無一是 ACG 導致。寶貴的預算和司法資源拿來管 ACG,只是在浪費珍貴資源甚至癱瘓司法人力。
這跟賣偏方一個樣,賣偏方的說關心你父母得癌症,實際上是花光你父母錢讓他們錯失治療機會,買偏方的錢拿去買有效的自費治療搞不好父母多活幾年。打 ACG 的口說保護孩童,實際上是把有限資源花光,用在無法幫助孩童的地方,錢如果省下來去做有用的事,也許真實虐童案、真實兒少性剝削就能少更多件,阻止不幸發生。
嚴打 ACG 的保守派,和賣偏方的騙子,他們的關心和愛都假的。只是一個圖財,一個只想滿足自己的基督教宗教願景(也許有些人還有趁機擴權搞錢),才不管對兒童到底有沒有用。
最近接連出現兒童受虐及兒少性剝削事件,加害者甚至與兒童保護單位關係密切,引起輿論關切,也有民眾和立委諸公呼籲修法。
筆者認為保護兒童,除了立法,也要提防賣「偏方」假友軍。有政府官員和宗教保守派,對持有真人性影片,有實際兒少受害的案件唯唯諾諾,稱其「讓人兩難」,卻對無實際受害者的虛構影視作品重拳出擊,揮霍兒童救命錢,就是賣偏方的假友軍。
賣偏方者口口聲聲為病人好,讓病人散盡家財,不只是讓病人做「無用功」,更讓病人錯失治療機會。政府預算花在無效治療的費用每多一元,能實際挽救兒童的經費就少一元。假保護兒童之名,卻把預算砸在安慰劑,實際上是戕害兒童。
打擊「湯姆貓與傑利鼠」無法減少虐貓。政府官員要績效,不是靠打擊虛擬人物濫竽充數、搞遮羞布。更何況主張嚴打虛擬人物的團體,尚且無法防止「自己人」虐童,信賴他們的「藥方」無異請鬼拿藥單。預算省下來,用在真正有用的措施,不知道能多救多少孩童?
-----
震聾發聵的好文,寫文章的作者一定是帥哥小鮮肉(?)
難得投稿中了一篇趕快慶祝一下 XD
今天偶然看到的,號稱 transformer 殺手的 Mamba 架構。從影片看來,Mamba 優化了 transformer 的複雜度,並且更加考量到現有 GPU 架構,實現更快的推理,並且在實際應用上很多地方可以平滑的替代 transformer (謎之音:那些用 transformer 做過的 paper 可以全部再做一遍)。後面李飛飛大老的團隊 U-Mamba 實做 CT segmentation 擊中了我 Q<>Q 我連 transformer 都還沒全部弄明白呢,
先做個紀錄,也許以後可以發想一些 idea
- 有說服力的邏輯推理方法大體有三種:歸納、演繹、溯因
- 可對文獻資料進行分析來推出自己的論點,例如衝突、解決方案等
- 也可以用於論文的討論和結論
- 歸納 inductive reasoning
* 由點到線,發現新的規律
* 對各種不同的資料進行歸納總結
* 由個別的證據推斷出一般性的規律
* 人類幾乎所有的知識都來源於歸納
* 常見的方式有求同和求異兩種
# 求同:找出各種不同文獻資料之間的共同點,推斷出較為普遍性的規律
# 求異:比較各種不同文獻資料之間的不同點,找到造成這種不同的關鍵因數或者是變量
- 演繹 deductive reasoning
* 由一般到個別,建立新的證據
* 文獻中已經總結出某種一般性的規律
* 結合我們當前實際情況
* 大前提 -> 小前提 -> 結論之三段論屬於演繹推理
- 溯因推理 abductive reasoning
* 由點到虛線的推理方法,提出新的假說
* 科學的前沿探索的過程中文獻中證據往往是雜亂而不完整
* 由已知的所有線索排除各種可能性從而最終推斷出真相和最有可能的解釋
* 從一堆看似雜亂無章的事實中獲得洞見
* 比歸納和演繹更需要創造性思維,類似偵探破案
* 要求研究者對於各種可能性有深刻的認識
* 結果一般是新的假說,需要進一步的實驗論證
- 推理方法為退化的歸納、演繹法,並不嚴謹
- 語文教科書的舉例論證、引用論證、比喻論證、對比論證等傾向修辭學而非真正的邏輯推理方法
這陣子為了 computer vision 還有 weakly supervised learning 的事情頭痛。要發 paper 需要 label 動輒破千的影像資料讓我快燒壞腦袋。
這應該是這陣子聽到最重要的 talk。重點在於 Snorkel 這個 project。相較於 supervised learning 要專家直接標資料,Snorkel 將問題從 data labeling 轉變成如何找出夠多的 weak labeling function,然後在目前我還沒搞懂的 labeling model 或投票機制作用之下,weakly supervised model 或 gold + silver label 的方法訓練出來的成果不會比專家爆肝差太多,但專家爆肝可能要一年才有辦法幾千份,labeling function 快的話只要幾天。
只是目前看到的 tutorial 都還在用 NLP 說明,還不知道怎麼做 weakly supervised object segmentation or detection。不過有 Oreilly 有出書整理,應該會比直接啃論文快些。
- 文獻綜述
* 引導出我們自己的研究目標
* 用文獻來支撐我們的自己的研究目標的重要性和合理性
* 用講故事的邏輯來寫我們的文獻綜述,需要有起伏
- SCQA 模板
* 情境、衝突、關鍵問題、解決方案
* 可以包含多重起伏
# 例如 Background and history -> 衝突1,解決方案1 -> 衝突2、解決方案2 -> ...-> 最終遺留問題
# 最終遺留問題可作為 future direction
* 可根據狀況調整順序
* 關鍵問題和解決方案已可被讀者接受 -> 開門見山 QASC 或 QACS
# 首先提出關鍵問題和解決方案直接點名本篇論文的研究目標
# 隨後再慢慢的介紹情景和沖突
* 追求衝擊力 -> CSQA
# 首先提出沖突引發讀者的關注
# 隨後再介紹前情和後續的解決方案
* 情境(S)
# 實現和讀者的對接,取得讀者的基本的信任
# 挑出文獻中最不具爭議讀者最容易認同的部分來寫
* 衝突(C)
# 起伏的開始
# 可能是一個顯然的挑戰
# 也可能是通過文獻分析才能夠發現的一個潛在的威脅或者機遇
* 關鍵問題(Q)
# 作者需要明示出解決所提出沖突的關鍵點在哪裡
# 往往最能體現出作者的眼光
* 解決方案(A)
# 一個有說服力的解決方案就能自然地帶出本篇論文的研究目標和它存在的意義
我司最近忽然提起可以試著用醫學影像發 paper。但我完全是外行,從數學到模型到寫程式都需要自學,還沒有人標資料,差點把我嚇出心臟病。
CV 和之前玩 NLP 不同。NLP (至少我自己那篇)可以用 regex 或其他方法先弄出不那麼精確的 label 再人工校正,不需要真的從無到有通通自己標,但 CNN 至少我目前還不會這些方法。所以只好趕快去問網路。
目前找到一門課還有一份 slide 可以看。
ECCV 2020 WSL tutorial: 1. Introduction to the tutorial on Weakly Supervised Learning
Weakly Supervised CNN Segmentation: Models and Optimization
來源
不管會不會看,松鼠黨先屯了再說 XD
最近不斷看文章,iwin 「兒童色情」事件個人感覺逐步明朗。
這件事根本不是「反兒童色情 v.s 肥宅」之爭,而是「基督價值 v.s 台灣多數價值」之爭。看推動者宗教背景深厚就知道了。
天主教、基督教天然敵視「性」,認為「性」本身是獸行,只有在「主」准許的婚姻之中,「性」將男女雙方以愛結合並產生後代,這時候的「性」才是好的。天主教、基督教強調兒童和青年應該是純潔的,和污穢的「性」不可以連結在一起,哪怕是虛構的兒童和青年也不行。
從這角度看就可以解釋保守團體的過度反應。明明 ACG 造成兒少性剝削極低,我國根本沒有。交友軟體、甚至陌生人手中的糖果餅乾對兒少都比 ACG 危險的多,也有真實受害案例,但保守派卻只管虛擬人物有沒有露點(連靜香洗澡都算),對真正傷害兒少的兇手視而不見。這些保守團體背後還都有一神教背景。
原來目的是傳教,不是為了保護兒童。和同婚一樣,宗教團體反同婚,說同婚不能生小孩、可以同婚那也可以跟摩天輪作愛...都假的,他們反對的真實理由是這樣違背神和教會的教誨。但是他們知道神和教會不是能上檯面的理由,所以就弄各種表面上的藉口。這些藉口都假的,駁倒他們就換其他藉口。保守宗教團體只想大眾聽他們的,從來沒有想溝通,畢竟只有凡人向神認錯,哪有神對凡人退讓的道理?神旨到凡人下跪接著就對了!多少年過去了,他們還認為「別人」用保險套是有罪的,這種人是能溝通什麼?
保守團體目前的作法,就是「販賣恐懼」,先說不怎樣怎樣做,真實小孩就會被害喔,然後再舉一些確實有問題的作品,例如重口味的漫畫(但這些重口本用現行妨害風化罪就可以法辦,根本不用曲解兒少法),引起民眾恐懼後就偷渡一竿子打翻一船人的提案,以實現天主教基督教國家兒童純潔化的宗教願景,連大雄偷看靜香洗澡都違法,名正言順的用思想罪打擊異教徒。
某些政治人物也不清醒,可能有人覺得之前得罪教會,導致選舉失利,乾脆擁抱極右派,但極右是遠離中間的死路。除非台灣伊朗化,倒退成一神教的地上神國,否則宗教保守派永遠不會滿足。
看美國共和黨墮胎權爭議就知道,宗教保守派的主張一直步步進逼,一開始說推翻全國墮胎權(Roe v. Wade)是為了尊重州權。推翻後發現各州公投一直輸,就推動調高公投門檻,不讓州民保護墮胎權。連這樣都失敗,就改口該由聯邦設定墮胎限制(這時候又不尊重州權了),一直亂下場就是共和黨被極右拖累,選舉一直失利。極右還要批評共和黨對生命的捍衛不夠。
我尊重他人信仰一神教的權利,但用強制的方式逼所有人接受一神教價值就是侵害他人。套釋 617 的話。ACG 就算要管理,也要基於「多數人普遍認同之性觀念或性道德感情」且「對少數性文化族群.....予以保障。」來管。色情的「性秩序」紅線應由多數人認定,不是一神教替全國所有人認定。