星期二, 6月 27, 2023

如何寫好一篇論文(05) - 文獻綜述的兩個基本點

原始出處



- 引言需要論證目標合理性,文獻綜述可以支持理性
- 文獻綜述要有「學」和「思」
- 學而不思則罔思而不學則殆
- 文獻綜述的「學」
    * 包括「所有」「相關」「主要文獻」
    * 證明我們已經全面了解相關知識
    * 若遺漏任何重要文獻,代表不專業、研究建立在錯誤基礎上
    * 引用文獻必須「全」「新」「客觀」
        # 客觀:觀點不相符的文章,不能因為立場視而不見
- 文獻綜述的「思」
    * 沒有思考,就只是複述他人觀點
    * 兩個層次思考:批判、分析
    * 批判:有效性、可靠性、優勢、劣勢、侷限性、顯著性、重要性
    * 分析:透過自己的分析:歸納總結、發現規律
        # 文獻資料和具體情況做演繹
        # 透過溯因分析建立自己假說
        # 透過共同點分析找出背後規律
        # 透過不同點分析找出關鍵因子
        # 透過比較文獻,找出現有研究空白,找到研究機會
- 要「六經注我」,用現有文獻支撐自己研究


全文連結

星期六, 6月 17, 2023

人生第一篇 SCI

連結


人生第一次發 SCI 竟然忘了寫日記 XDDD,把當時的臉書動態重整後記下來。4/25 正式發表,現在記一下也不算太晚 XD

---
成功發表人生第一篇 SCI original article,預計再一兩個月內正式 publish。作為人生第一篇有分數(IF=3.23)的文章,值得發廢文慶祝 XD
寫作動機是想用 NLP 解掉搜尋引擎結果不精確的問題,讀 paper 查別人解法時,發現了研究機會。剛好公司其他系統也有類似問題,就從最有賣點的角度切入,成功淼了出來。
過程中寫 code 不難,PyTorch 的封裝非常完善。資料標註(n=6000)花了些時間。最難還是寫文章本身,文字反覆修改,中間穿插補實驗,從 11 月跌跌撞撞補到現在。幸運的是剛好趕上 ChatGPT 神器現世,可以幫我把零散、片段文字瞬間轉成通順的英文,文字拆分、縮減、重排也不在話下,作者只要優化細節和確保正確就好。
這篇是「搜尋引擎土炮」系列事件的最輝煌成就了。搜尋引擎出 bug 要解,自己弄 AI 流水線。AI 流水線需要的實驗和模型,自己包,再請前輩指導投稿。AI 需要的資料,從自己土炮的搜尋引擎撈的,資料標注,自己弄的。應該可自稱一聲,苦工之王。
不過爆肝還是值得的,以六千鉛汞,配九九八十一 epoch 練就 BERT 大還丹,服用後白日飛昇,WoS 天榜題名,值了 XDDDD
---

本以為 accept 後天下太平。結果 publish 又一波爆肝。

為了確保準時 publish,期刊所有 copyediting 和 proof reading request 都有時限,都要求 2~3 工作天內回覆。下班和週末又沒了,都在看自己文章,首刷、二刷、三刷、四刷、 N 刷解 issue。當初「應用 paper 可以寫三十頁」多得意,現在解 bug 就多噁心。現在吞下肚的淚,都是當初灌的水。

期刊 copyediting 是找外包編輯,體驗普,有時對期刊最新規定還不清楚。跟外包對線,還要花時間詳閱期刊最新 guideline 引經據典打官司 。deadline 很緊的結果,就是進 proofreading 後又發現一波 bug。趁著期刊週末沒上班沒辦法把稿件鎖起來,Author final confirmation  硬是厚著臉皮連更好幾輪,刷到 editor 客氣寫信建議別再更,否則 publish 來不及 XDDD
整體而言,對 JMIR 的投稿體驗還是很好。付快速通關費後,JMIR 所有的決定都非常快。2/08 送件,3/11 給 revision。3/21 回 revision,3/24 accept。從 11/15 開始做實驗動筆到 4/25 publish,快半年的煎熬順利結束,很幸運沒演變成凌遲。終於可以把資料夾封存,去做些別的事情。發表時間剛好靠近生日,就當生日禮物了(X)。
最後感謝本院 AI 中心,在過程中忍受某沒見過世面的菜逼新人不分晝夜詢問智障問題,幫忙解答疑問還有對稿件提供建議,讓新手順利避過雷區,最終人生第一篇 SCI 得以順利完成 (完結灑花)
----


其實事情還不算全部完結,這次忽然急著半年生 SCI 是有些職涯規劃的原因。只能說壓力使人成長。以前當 R 固定時間 meeting 然後給教授指導連一篇都弄不出來,現在被逼急就從無到有半年就一篇。長輩應該覺得驚喜(?)

全文連結

星期日, 6月 04, 2023

星期四, 6月 01, 2023

去日本玩

這次工作又嚴重疲勞,跟主管爭取減量失敗,但主管同意讓我放假,就和家人一起去日本了。疫情之後難得的出國,這次去東京。

 

成田機場剛下飛機,不得不說一樣都市,東京的空氣比台北、台南好非常多。天空也非常漂亮。







在日本銀座吃到最貴的一餐,A4 和牛涮涮鍋,含服務費總價 18K+ 日圓,這是 兩 人 合 點  一 客 的 價 錢!Menu 還有更貴的 A5 和牛,但價格吃了會心痛就點 A4 就好 XD。但真的好吃沒話說,就連台北也沒吃過這麼好的味道。



 
 
肥宅必去秋葉原,去的時候跟母親分開逛,媽媽逛銀座我逛宅店。哪怕最後沒買東西,日本宅聖地的宅味就讓人回味。
 




買到的KKDay 上買到的富士山行程。早上七點(台灣時間六點)起床趕車差評。但去的地方都是自己很難去的。


鳴澤冰穴,其實有危險度的景點。很多地方狹窄溼滑,必須很謹慎矮身慢走,避免撞到頭和滑倒。一次進去一整團人,一人跌倒感覺就能整個樓梯骨牌一起倒。再有下次我不帶母親進去了。

涮超貴 A4 和牛的感動瞬間。很少遇到要這樣涮的 XD


東京迪士尼,Baymax 飛車。乍看以為是和旋轉咖啡杯一樣的東西,但其實軌道會一直改變,並且轉彎的時候會離心力甩尾,瞬間速度其實很快。有人坐到叫出來。還有更多、更完整的遊樂設施影片,但避免米老鼠帝國查水表還是不放了,自己欣賞 XDDD


秋葉原某不禁止拍照的宅店,手機放胸口,模擬人走路逛店的過程,拿來日後回味的 XD


上野阿美橫町,小時候來東京沒來,這次和母親第一次來。但兩人共同感想是:這根本就台灣夜市。熱鬧、有氣氛,但東西品質普,跟銀座比起來一個天上一個地下,應該就來一次體驗氣氛,不會來第二次,也不會在這裡買東西。

年齡已奔四,體力漸感變差,難得疫情解封能出國,母親身體也健康可以一起出遊。下次不知何時,甚至是否能再有這樣的條件了。


全文連結

星期日, 3月 26, 2023

如何寫好一篇論文(04) - 確立研究目標的兩個原則

原始出處

 


- Foundamental Problem
    *「大處著眼」:有意義的大事業,使我們的工作有意義,使我們可以成長
    * 研究終點站,為研究指明方向
    * 宏偉的城堡,通常和許多研究者共享
    * 來自真實市場需求:專家建議、科研基金服務宗旨


- Objective
    *「小處著手」:雖然是小事,只要朝正確大目標前進,長期累積或與旁人研究疊加,就能造成大影響
    * 研究里程碑,為本篇工作指出評價標準
    * 一塊磚頭,通常由我們獨享,可能很小
    * 根據我們的資源、條件制定合理的目標

- Introduction 就是把「小事」和有意義的「大事」連結
- Introduction 從普遍的大問題,或眾人認同的大目標出發,發現關鍵需求逐步細化,訂出合理當前目標
- 論文主體,透過當前目標,制定具體任務,得到具體研究結果
- 論文結論,將研究結果與研究目標相比較。再論述當前目標完成後,對長遠目標的貢獻,得到完整論文
- 要能夠論述長遠目標、和當前目標的關係,有效說明當前目標的合理性,要做好文獻綜述


全文連結

星期日, 3月 12, 2023

星期二, 2月 21, 2023

星期四, 2月 09, 2023

 用 AI 修英文可不可行?

近期,ChatGPT 受到了非常多的關註,各種應用被開發出來,甚至很多人使用 ChatGPT 寫論文,引發爭議導致許多期刊禁止使用。但是真的完全不能用嗎?個人認為未必。ICML 的規定值得參考。ICML 是禁止使用 ChatGPT 的頂級會議,有詳細說明不可以使用的原因:


連結

   The Large Language Model (LLM) policy for ICML 2023 prohibits text produced entirely by LLMs (i.e., “generated”).  This does not prohibit authors from using LLMs for editing or polishing author-written text.
   The LLM policy is largely predicated on the principle of being conservative with respect to guarding against potential issues of using LLMs, including plagiarism.
   
我認為用 ChatGPT 進行輔助性作業,例如:換句話說,化繁為簡,改善用字....還是可以的。前提是原創文字來自人類,ChatGPT 只是輔助。


禁止使用 ChatGPT 的主要原因是原創性和正確性問題。首先,論文作者必須能對研究質量進行最終把關並負責。ChatGPT 無法負責其正確性的把關,因此不能擔任作者,也因此只有人類才能成為作者。

其次,如果研究人員使用 ChatGPT,生成具有原創性的文字。由於 ChatGPT 不能擔任作者,理論上作者應該要列入發明ChatGPT 的人或提供訓練數據的全體人類。但由於明顯的原因不可能做到。這導致實際貢獻者沒有出現在作者名單,引發抄襲問題。  

把握住根本原則後,再來看 LLM 的使用。在 AI 只是幫忙「打磨」文字的場合,文字本質是由人類作者原創,AI 幫忙編修並不減損人類的原創性及貢獻,並且最終品質仍有人類負責把關,所以無上述原創性、正確性問題。

現有很多服務、包含 DeepL、Grammarly 等也提供自動修改人類文本的功能,他們在現在和未來也可能使用 deeplearning 或 LLM,但我想不會有人認為有問題。因此,如果是
把 ChatGPT 當成高級翻譯或自動編修軟體來用,倫理上應該是沒什麼爭議的。最多被問的時候再指出有拿 AI 做 text polishing 或 paraphrasing。

最後不得不說,DL/LLM 真好用。我現在寫論文 DeepL、DeepL Write、ChatGPT、
Grammarly 四大守護神獸交替使用。中文底稿弄好,先丟 DeepL 機翻,人工小改,請
ChatGPT 潤筆重排、再丟回 DeepL Write 清潔,最終結果 Grammarly 大英修。文章的生產速度和質量都比預期好很多。

P.S:本文有用 ChatGPT 小潤筆 XD

全文連結

星期六, 1月 28, 2023

商周好文:待得久不是忠誠,是你「跑不掉」!為什麼想升主管就別太認真工作?

原文 

商周好文,很清楚點出高階主管和員工看事情的不同。其中很多觀念乍看確實不好接受,但其實有道理。

淘寶網馬雲經常語出驚人,比如他說特討厭太認真工作的人,鑽進去就出不來,帶給公司的創新少,看不出顯著貢獻。而且他也批評,重視細節的人就講不了格局,把公司的發展框限在小領域裡,一個大浪來就滅頂。
一旦讓公司覺得你『跑不了』,就會輕忽你的重要性與貢獻度。
只鎖住一個專業,給人的印象就像「很宅的工程師」,就是一個「窄」字,和「廣」正好對立。
很多都打中我啊。我也是學生畢業後就在同一機構工作,又宅 QQ 全文連結

星期二, 1月 24, 2023

如何寫好一篇論文(03) - 研究選題的三種途徑

原始出處

 

- 回答正確答案需要「點」的知識,問出正確問題需要「面」的知識
- 問出正確的問題,科研就成功了一半。
- 確立新研究課題有三種途徑,可單獨或混合使用
  * 填補研究空白
    # 針對已被廣泛認可的老問題
    # 通常具備技術挑戰性
    # 重要的是「創新」,如新的解決方案、其他領域借鑒想法
    # 需了解前人做過什麼,我們有何不同,我們貢獻和他人怎麼配合
  * 延伸現有研究
    # 追蹤研究歷史,一項接一項的成就
    # 牽涉新問題和新領域、更多的新機會
    # 新研究者容易迷失
    # 須牢記長期目標,時時自問研究有何意義,對受眾有何貢獻
  * 把成功研究在不同情形進行複製
    # 成功研究,換不同變量、不同樣本群...
    # 這是相當常見、普遍且相對安全的方法
    # 需避免複製過程中可能發生的錯誤
    
- 好研究課題的要件
  * 具體、可行
    # 所有術語、變量都有明確定義
    # 整個課題有明確的邊界
    # 不存在先入為主的假設
    # 適合現有的資源條件
  * 開放、可爭議
    # 不可證偽的課題不科學
  * 能夠激發創新

- 最牛的兩種課題
  * 研究者填補了當前所有的漏洞,此課題無可再做
  * 突破了目前的知識框架,為更多機會打開新的大門

全文連結

星期日, 1月 01, 2023

 如何寫好一篇論文(02) - 引言的邏輯解析


原始出處

- 引言可拆成兩段:第一段研究機會和第二段解決方案
- 第一段
    * 從普遍的大問題(Problem)開始,到一個研究空白或問題(Question)結束
    * 說服讀者,為了解決某個大問題,我們必須解決某個具體的研究問題
- 第二段
    * 透過建立清晰的研究目標,去填補第一段建立的研究空白或問題,佔領研究機會
    * 目標不只本論文的研究目標,也包括作者的長期目標
    * 長期目標(Goal)呼應第一段的大問題(Problem)
    * 當前目標(Answer)呼應第一段的研究空白或問題(Question)
    * 為了達成長期目標,我們必須實現某個特定目標    
- 引言如搭橋
    * 讓讀者走進我們的研究世界
    * 橋的一端是讀者的已知
        # 和讀者的知識框架建立聯繫
        # 提出讀者關心的問題
        # 從讀者已經接受的觀念入手
    * 橋的中間逐漸加入讀者未知的文獻資料
        # 說服讀者某個問題值得研究,我們和讀者應該知道他們的答案

範例:問題 X 的重要性已經被學術界廣泛認可,研究者 A 發現 a1 研究者 B 發現 b1,基於上述理由回答問題 c1 對解決問題 X 至關重要

全文連結

 如何寫好一篇論文(01) - 論文的三段式結構


最近趕 Paper 弄到一個段落。試著把之前聽過的好課做成筆記,方便自己複習。劉教授原始課程質量非常高,講的其實已經非常精簡,完全沒有任何廢話,他也在 B 站免費公開,強烈推薦去看。筆記的目的是幫我自己複習。

- 論文其實可以拆成三段:引言段、中间段、结论段
- 引言段和結論段用議論文方式寫作,講究邏輯性
- 中間段則是敘事文,平鋪直述把工作描述出來
- 引言段:
     * 說明研究目標合理
     * 整篇論文存在價值的根基
     * 告訴讀者這篇文章(讀者未知)在整個領域(已知)處於什麼位置。
     * 使用文獻作為證據
     * 從普遍(大家普遍接受的問題或觀念)到特定(我們的研究目標)
     * 也能指導結論段
- 結論段:
     * 說明研究結果價值
     * 告訴讀者這個研究結果是有價值的
     * 使用研究結果文獻作為證據
     * 從特定(特定的研究結果)到普遍(普遍的意義)
- 中間段:
     * 即使沒有引言和結論,也能當成獨立的研究報告
     * 加上引言和結論後,形成完整論文
- 如果中間段是一個「洞」,引言段讓讀者願意走到洞裡面看,結論段則是引導讀者從洞走出去
全文連結

星期一, 12月 19, 2022

星期日, 12月 11, 2022

健身房攻防紀實

原本去的小健身房租約到期倒了,不得不換健身房。工作場所附近只有一家健身房器材符合需求,其他間不符需求。但這家健身房有業務、糾紛多、價格有陷阱,因此去之前做了功課,問了有簽的朋友,成功講到比較合理的價格。這次過程大概是這樣的:

我:您好,我想詢問一年、兩年方案分別怎麼算
業:我們入會費處理費 6888,兩年月費 1988。但我可以給您作主入會 3888,月費 1788(微笑)

我:你們這分店開幾年了?
業:四年
我:可是我朋友之前來,月費只簽 988 耶~~~(爆擊)
業:(眩暈)那個是開幕期間,設備不完善或施工中,所以才有這個價格 blahblahblah
我:1788 太貴了,我希望簽 1288!(1288 為攻略上 2022 年的成交價)
業:我去問一下長官看可不可以(遁走去小房間,結束這回合)

業:(回來)我可以給您用 XXXX 專案,這方案 0 入會費,只綁一年而且月費就是 1288,請問您今天可以簽約嗎?
我:我希望將合約帶回去審閱,我簽約習慣先看。我今天運動就單次付費 OOO 元
業:不用擔心太多,我們有七天鑑賞期,不滿意可退費。這樣也不用多付一次 OOO 元 blahblahblah
我:可是你們七天鑑賞期不是規定不能使用器材嗎?(甜笑)
業:(眩暈)...合約上是不行,但我可以作主 blahblahblah
我:(內心 OS:印象中合約還有條,簽約後雙方合意以合約紙本為主,口頭約定不算數吧?)
    我希望合約可以帶 回 去 審 閱,我今天就單次付費,當然簽約我還是樂意找您 blahblah
業:(打斷我)我懂您意思,但我希望各退一步,您約帶回去,今天付費 OOO 就用信用卡可以嗎?

最後我信用卡只刷單次付費的錢,約帶回來檢視完畢後,就進行簽約了。簽約首刷金額有把我的單次體驗費用扣除,等於讓我免費體驗一次感覺還不錯。很成功的沒踩到陷阱,當然我知道健身房絕對不虧。平局結束第一回合。

我懷疑這間健身房的話術是中央制定,全台統一。導致業務出的招 100% 在攻略上都見過(攤手)。之後應該就是應對教練課推銷吧。

全文連結

星期日, 11月 06, 2022

Jupyter notebook module 找不到除錯

參考文章連結 

今天玩 python NLP 遇到鬼打牆現象:明明已經 !pip install spacy 但 jupyter 執行 import spacy 一直說 module not found。 排查後才發現是 jupyter kernel 的問題。我 docker container 原本就自帶 python 3.7,apt-get install 又自己裝了一套 python 3.9 並只認自帶的版本,兩者各自獨立,前者裝的 package 後者找不到。 

後來 Dockerfile 做了些設定

apt-get install jupyter-client
pip install ipykernel
python -m ipykernel install --user

其中裝 jupyter-client 是為了能執行 jupyter kernelspec list。後兩者則是讓 jupyter 認我裝的 python 而非 jupyter 自帶的。Dockerfile 改好後 rebuild 問題解決。

全文連結

Docker network interface 好文

出處

太久沒玩 docker 又犯了小白錯誤。

在 container 裡面裝了 jupyter-notebook,結果在 container 裡面 wget 連的到。但切回 host 和外部環境就連不上。docker file EXPOSE 有開 port,docker run port 有 forward 但就是莫名 connection refused。

後來搜尋後才發現這是典型錯誤。jupyter-notebook bind 的 127.0.0.1 屬於自己 network namespace,我的 127.0.0.1 不是你的 127.0.0.1。後來加個 -ip="*" 廣開 binding 解決。

全文連結

星期五, 10月 28, 2022

星期三, 10月 26, 2022

VirtualBox Ubuntu VM 更改檔案空間大小

圖轉載自這裡 

之前曾多次遇到 VirtualBox VM 空間不夠問題,建立 VM 時給的硬碟空間太小,docker 弄一弄 VM 硬碟空間就不夠了。但按照 Stack Overflow 上的解法怎麼改,分割大小都是舊的,最後往往重裝 VM 解決。但每次都一堆 docker image 重抓真的非常麻煩。後來讀文章才整理出解法。 


 

問題根本可以用這張圖說明,現在的 Linux (我用 Ubuntu 20.04 LTS)在檔案系統上疊太多層抽象化,要正確擴充可用空間大小必須每一層都改到。在 VirtualBox 的步驟大概是 

1. 修改「實體硬碟」的大小

VirtualBox 需要把所有 Snapshot 取消。有 Snapshot 那 VM 寫入的「硬碟」實際上有可能分散到 snapshot 裡。然後 GUI 的虛擬媒體管理員直接調大小。 

2. 修改 Partition 大小 

先用 lsblk 看要擴容的檔案系統到底實際是掛在哪顆硬碟上。我是 /dev/sda3,這時

sudo growpart /dev/sda 3

下達後用 lsblk 檢查,/dev/sda3 應該已經擴大,但下方掛的 Logical volume 大小還是舊的,sudo pvdisplay 大小也是舊的 

 3. 擴大 Physical volume 大小

pvresize /dev/sda3

再來用 sudo pvdisplay 看大小對了,但 lsblk 看到的 ─ubuntu--vg-ubuntu--lv (logical volume)和 df -h 看的大小還是舊的

4. 調整 Logical volume 大小

sudo lvextend -l +100%FREE /dev/ubuntu-vg/ubuntu-lv
應該要可以看到 Size of logical volume ... changed from...,再來
sudo vgdisplay

應該就要看到 VG Size 為新的大小,此時 df -h 看到的 Filesystem 大小還是舊的,此時應接最後一道工法

5. 調整 file system 大小

sudo resize2fs /dev/mapper/ubuntu--vg-ubuntu--lv
最後 df -h 看到分割區大小變大,打完收工!現在 Linux 的檔案系統真的抽象化堆的太誇張了....
全文連結

星期一, 10月 24, 2022

Record of Lodoss War-Deedlit in Wonder Labyrinth-

Steam 頁面

 

全破了一輪。遊戲是橫向捲軸、類惡魔城遊戲。遊戲長度只有幾小時就能全破一輪。目前好像沒多周目要素。作為動作遊戲簡單爽快,裡面有些小機制,例如風火抗性要即時、輪流切換才能順利破關和打王有趣。

不過遊戲最香的,還是長腿精靈大姊姊蒂德莉特,哪怕是像素版一樣香。遊戲聽說還是羅德斯島戰記小說原作者的監督下完成的。

唯一小遺憾的是結局,雖然從小說續作已經知道了,但看到和帕恩的相遇只是夢一場,恢復記憶醒來後蒂德莉特去墳前告別,仍然是有點心酸。

全文連結