好久沒發文了,來寫點廢文紀錄一下 XD
我最近 LLM client 改用了 CherryStudio,之前用的是 LobeHub。我習慣用 BYOK 自己的 key,再搭配一個第三方客戶端,就可以以很低的價格使用 大模型,而不必每個月固定支付月費,然後被綁在官方的固定介面上。
最近第三方的工具也越來越進步。我之前用的一款,好像是 NextChat 好像一開始還不支援螢幕貼圖和附件,所以要問 pdf 的數學還得自己慢慢打字,嚴重限制使用 AI 的效率。總之,我後來改用 LobeHub,但新版介面越來越花哨,還要綁雲端,整個介面用起來非常複雜,越來越難用。而真正讓我決定離開的原因是它新版 O3 Deep Research 功能壞掉了。我在 GitHub 上丟了一個 Issue,但結果沒人解,我也沒有時間自己處理。結果它就躺了很久,變成了 Inactive Issue,於是我決定換一款軟體。
後來找到這款 CherryStudio。該有的功能都有,也包括設定 Provider、上傳附件、傳螢幕抓圖、標記重要對話防止誤刪,備份匯出匯入等等。O3 Deep Research 也能用了。最近才發現一個新功能,就是 CherryStudio 其實可以改變資料夾的暫存位置,即我可以將資料夾指向 OneDrive。這樣一來,換電腦辦公的時候,Cherry Studio 的內容就能自動同步,包括我和 AI 的對話紀錄。這對我寫論文極度重要,因為我經常需要和 AI 討論文章的事情,這些紀錄不能隨便丟,而且需要能查的時候馬上可以查到,如果關鍵對話分散在 N 台 PC,要用遠端桌面去看關鍵討論在哪裡就極度不方便。CherryStudio 能將 OneDrive 設定為工作目錄就一口氣解掉了同步需求。目前應該會繼續用這款。
星期六, 5月 30, 2026
星期三, 4月 22, 2026
影片:同一組研究數據可以發幾篇論文?重複使用數據時一定要知道的紅線與原則
最近剛好遇到這個議題,這影片講的不錯,我懶得自己總結就用 AI 幫忙了 XD 以下是 AI 總結:
完成一篇論文後,看著電腦裡幾十 GB 的原始數據,你是否也想過:
這批數據真的只能發一篇文章嗎?
答案是:可以再利用,但有嚴格前提。
如果操作不當,可能構成學術不端;如果操作得當,則是合理延伸研究價值。
一、兩條不能踩的紅線
1. 重複發表(Duplicate Publication)
這是最嚴重的違規行為。
指的是:
• 同一研究結論
• 同一核心內容
• 只是換標題或小幅修改
• 卻沒有清楚引用先前論文
可能後果包括:
• 撤稿
• 通知單位
• 影響學術聲譽
判斷標準很簡單:
如果兩篇文章本質上回答的是同一個問題、同一個結論,那就是重複發表。
2. 切香腸(Salami Slicing)
指的是把一個完整研究,刻意拆成多篇小論文,只為增加發表數量。
例如:
• 第一篇寫血壓變化
• 第二篇寫心率變化
• 第三篇寫副作用
• 第四篇寫性別差異
但其實這些都來自同一研究設計與假設。
自我檢測方式:
如果幾篇文章可以用同一研究假設、同一方法來概括,那你很可能在切片。
二、什麼情況下可以合法再利用數據
關鍵只有一句話:
第二篇論文必須回答不同的科學問題。
以下範例舉幾種合理的樣態
1. 從描述現象到解釋機制
第一篇:
A 與 B 顯著相關,回答的是「是什麼」。
第二篇:
為什麼 A 會導致 B,回答的是「為什麼」。
探索性研究到機制檢驗,研究層次不同,是合理延伸。
2. 切換分析視角
第一篇:
平均效果如何。
第二篇:
誰受益最多,哪些族群無效。
整體效果與個體差異是不同研究問題。
3. 跨層次分析
若資料有嵌套結構,例如學生在班級中、員工在公司中。
第一篇:
個體層面分析。
第二篇:
組織層面如何影響個體。
研究層級改變,問題自然改變。
4. 引入新的理論框架
同一組數據,用不同理論重新詮釋。
前提是:
• 清楚說明為何需要新理論視角
• 解決新的理論問題
不是換湯不換藥。
5. 補充新數據
即使只增加部分新數據,例如:
• 新實驗
• 新驗證
• 新變項
都能提升論文的原創性與說服力。
三、實務操作四步驟
第一步 先寫下兩篇論文的研究問題
問自己:
第一篇回答什麼?
第二篇回答什麼?
如果兩者能用同一句話概括,請重新設計。
第二步 主動引用前一篇論文
在引言或方法中說明:
• 數據來源
• 之前做過哪些分析
• 本文新增什麼貢獻
越透明,越安全。
第三步 在 Cover Letter 主動說明
投稿時告訴編輯:
• 此數據曾發表部分成果
• 本文研究問題不同
• 核心發現不同
編輯最怕的是隱瞞,而不是重複使用。
第四步 盡量增加新內容
例如:
• 新理論
• 新方法
• 新分析
• 新數據
這會讓文章質量大幅提升。
四、現實層面的提醒
即使在規則上可行,也要考慮長期影響。
1. 導師可能不認同
有些導師認為與其重炒舊數據,不如開發新研究。
2. 履歷會被看穿
如果多篇論文高度相似:
• 申請博士或教職時容易被質疑
• 同行一眼就能看出是換皮文章
學術界重視的是你解決了什麼問題,而不是發了幾篇文章。
3. 期刊越來越透明
現在許多期刊:
• 要求聲明是否使用相同數據
• 要求上傳前一篇文章比對
• 要求提交原始數據
學術環境正朝向公開與可重現發展。
結論
數據可以重複使用,但研究問題不能重複。
真正的原則是讓數據服務於新的研究問題,而不是讓數據牽著你的鼻子走。
全文連結
星期三, 10月 15, 2025
好文:The RAG Obituary: Killed by Agents, Buried by Context Windows
這文章真是打動我心,明顯作者踩了一堆坑。RAG 本質就是 workaround,當 LLM context window 不夠長,無法塞進足夠資料的前提下,RAG 就是沒有辦法的辦法。RAG pipeline 很長,Chunking、Embedding、Search、Reranking 每個步驟都可以 fail。而且 upstream 爆了,往往 downstream 錯誤不會消失,只會放大,最終變成災難性的低準確度。而且 RAG 方法有先天缺陷。例如本文提到的,長文本之間會有複雜的依賴關係,一旦進行 chunking 可能某些語義或查詢路徑就不見了。
不過說這麼多,對我個人好像也沒什麼幫助啊。我司不想買,連 RAG 的單顯卡都下不來。真的要做 RAG 的話,也只能開源系統套一套,開源沒辦法,就真的沒辦法囉。至於像這篇說的一樣開發 agentic search,只能說夢裡什麼都有 XD
星期二, 10月 14, 2025
為什麼論文不被送外審
很好的影片,文中提到幾個我之前沒有想到的方法。首先,在 Introduction 部分引用目標期刊的相關文章,可達到15篇以上,最好是三年以內的,可以影響 IF 的計算,能引期刊主編、副主編的文章更好。如果沒有同樣的研究問題,可以引用上一層的背景問題。甚至為了做到這一點,可以每投一家期刊都重新改寫一次 Introduction。
還有就是,原來期刊副主編不會很認真地看論文,可能只是看完 cover letter 和 highlight,就決定這篇文章要不要送外審了。Cover letter 應該更有內容,包括研究方法、解決問題的方式,傳統方法存在的問題、本文的創新之處,文章的影響力,包含應用對象、結果、方法可行性。最後再總結一句,指出這篇文章符合本本期刊哪個主要研究方向。這種寫法比我原有 Cover letter 好太多了。(抓圖出自上方連結影片)
星期一, 9月 22, 2025
星期日, 9月 21, 2025
AudioPen 線上聽打軟體
一直沒有找到理想的聽打軟體。網上有許多免費聽打軟體,但它們僅支援簡單輸入。一遇到醫療或研究等專業場景,準確度就會大幅下降,根本無法使用。我也試過一些中國軟體,功能雖然強,但需要安裝很多來自中國的軟體,感覺有點害怕。隨著 OpenAI 的 Whisper 興起,網上也有一些免費 GUI 可以串 API 來使用,但這些工具發展尚未成熟,總是有這樣那樣的小問題。Word 聽打雖然好用,但遇到中英混雜的情況,辨識也常常失敗。通常需要中文用聽打,英文則手動輸入,使用起來不方便。此外,面對專業詞彙時準確度也不夠。
今天試用的這款 AudioPen 解決了大多問題。我特意試過中英文混雜的醫療病歷,發現它能辨識度很好,遠勝網路免費產品甚至是 Word。使用時,只需在瀏覽器上操作,不必安裝 Client。功能簡單但實用,聽打輸入後,可以同時提供大模型整理好的版本和原始聽打版本。此外,它有手機 App,可以錄音後在電腦上取回聽打結果。目前我想到的各場景辨識正確率都很高,雖然有些小錯誤,但已經很滿意。這篇文章就是用 AudioPen 聽打後修改的,所以濃濃 AI 味 XD
星期五, 9月 19, 2025
星期二, 9月 02, 2025
星期日, 5月 18, 2025
好文 - [問卦] 有人有Gmail帳號被盜的經驗嗎?
恐怖的故事,應該是亂點檔案, browser cookie 被偷,後面全線崩盤。不過失主運氣好,帳號被偷的時候剛好在電腦旁邊,而且駭客腳本漏了另一隻 2FA 手機,這才有辦法把帳號搶回來。
好在偶從來不用什麼 Google password manager 或 authenticator。Google 帳號被偷 password manager 和 authenticator 跟著自動叛變實在夠瞎。
全文連結沒想到竟然被駭,Gmail差點拿不回來!
週五晚下載檔案後,掃毒軟體確認安全,結果點開後沒異狀,就繼續使用電腦。
過一陣子,卻發現Gmail登入不了,二階段認證的手機也無法使用,
密碼輸入竟然沒辦法進入帳號。急忙嘗試密碼重設,但手機遲遲收不到驗證通知。
這可是從beta 用起用了快20年的Gmail啊!
好不容易進到救援頁面,認證資訊竟然都被改掉,幸好最後一個選項的號碼
像是之前多設一支少用的備用手機號,試了一下竟然收到驗證碼。
趕快改密碼,進入帳號管理,果然所有認證資訊都被更改,立刻刪除並恢復原設定。
忙了40分鐘,終於拿回主控權!
駭客入侵後,短短三分鐘內就成功奪取我的Gmail,估計是直接跑腳本:
New passkey added to your account
A new sign-in on Windows
Your password was changed
Recovery phone was changed
Recovery email was changed
Phone number added for 2-Step Verification
2-Step Verification backup codes generated
Google Account PIN changed
Recovery secret question was changed
看來像是,
- 新增通行密鑰
- Windows新登入
- 修改密碼、恢復手機、備用郵件
- 設置2步驗證手機號,生成備份碼
- 更改Google帳戶PIN與密保問題
接下來的40分鐘內,駭客利用我的Gmail掌控我存在google password manager
的所有帳密,並透過帳號綁定他的手機,使Authenticator也轉移過去。
接著掃蕩我的虛擬幣平台(Nicehash、Coinbase、Binance),轉走資產;
侵入社群帳號(Facebook、Instagram、X)及 Steam 修改密碼、亂發內容;
甚至在Facebook Market上狂做交易。
幸好這一切發生時我還沒睡,搶回Gmail後迅速追回其他帳號,
但仍花費不少時間,還得通知交易中的買家停下交易。
事後補救:電腦,手機和網路Router全面Factory reset,
密碼全部更換並改用KeePass儲存,移除Google綁定的信用卡,
定期檢查登入裝置並登出陌生設備。在帳號添加多支手機號,2FA必須開啟,
更重要的是管好手避免亂點不明檔案或連結。
幸好這次在醒著的狀態下才得以救回帳號,如果是趁我睡著才下手,利用我的身份
進行詐騙,後果真不堪設想。
這邊要問個卦, 駭客怎摸那麼厲害,明明帳號有設2FA,
為什麼駭客改我帳號時, 我手機竟然push或簡訊都沒收到??
要等到被sign out 才知道???
還有人知道萬一Gmail 真的被盜, 資訊全被改要怎麼找回嗎?
谷歌有服務專線可以打嗎? :p
星期三, 3月 26, 2025
星期四, 10月 10, 2024
星期二, 10月 01, 2024
如何寫好一篇論文(10) - 如何從文獻推出自己的論點
- 從文獻出發,推出自己的觀點
- 寫作終極目的:為讀者創造價值,不是為了證明自己。要以服務讀者為中心
* 推出自己論點前,把各方面情況掰開揉碎給讀者,幫讀者自己判斷,自己的意見當成參考意見,在讀者獲得充分信息之後再呈給讀者,反而有好影響力
- 五段落寫作模板
* 第一段:分析、分解問題。幫讀者問題分析和考量我們面臨問題的各種不同方面,各種不同角度
* 第二、三段:對不同方面、不同角度組織文獻資料分別進行討論。
# 例如第二段講正方,第三段講反方,並在兩者間達成平衡
* 第四段投入核心論點、關鍵砝碼,打破平衡,實現影響力
* 第四段要補充、提昇讀者現有認知或文獻討論體現的認知
# 例如一直以來認為重要的,你認為是次要的
# 大家認為是複雜的問題,但你看出簡單的邏輯
# 不同角度切入問題,發現新的威脅、機遇、衝突
# 現有衝突中發現新的關鍵問題、解決方案
* 第五段:對第四段提出的論點進一步發揮
- 先建立平衡,再打破平衡的模式,類似古代謀士,先提出上中下三策分析利弊為君主提出充分信息,顯示自己考慮問題細緻和客觀公正。最後只要關鍵處輕輕一點、就能打破平衡、影響決策。
星期日, 6月 16, 2024
星期六, 5月 11, 2024
星期五, 5月 10, 2024
Probabilistic Machine Learning -- Philipp Hennig, 2023
好課,把 ML/DL 會用到的機率知識整合起來,而且深度非常夠。
現在坊間「AI 背後的數學」課和書籍不少,但大多數太淺,例如微積分可能就講到 chain rule。對於看 paper 來說完全不夠用,課本和 cutting edge research 有巨大落差。直奔數學系的課,內容又太多不知從何學起,像本座高等微積分現在才換了老師剛看到收斂數列的性質,初微、線代課看完了現在習題都沒做 XDDD 課程還提供投影片讓人自習。非常慷慨。
原本是 B 站上看的,但 B 站沒搬運到最新的版本,且字幕不全,就去 Youtube 找最新完整版了。
星期四, 4月 25, 2024
網路文章:投期刊返修寫Response的時候,應該寫詳細一些還是簡要點?
知乎上很好的文章,擷取重點:
1. 所有的回復目的只有一個:說服 Editor,必須解決所有審稿人的疑慮,突出文章的貢獻。
2. 如何得體又有理有據的回覆強硬拒絕的審稿人
3. 一定要對 Editor 說一些好話,這要在整體回復審稿人意見之前寫上去。
得體回覆審稿人的模板:We appreciate the reviewer for carefully reading our manuscript and makingtheir insightful, critical, and constructive feedbacks. We appreciate that their comments have enabled us to prepare a greatly improved manuscript.(誇他) However, we respectfully disagree with the assessment of this reviewer regarding ourinnovativeness,analysis, and conclusions that the (自己的東西) is a common and unconvincing architecture. (反對他)We apologize for the previous poor formatting and some disputed descriptions of our manuscript, which may have made some of this evidence unclear. (對自己文章不足進行道歉)For this reason, we have revised the statements in our introduction and discussion to better highlight the novelty and advancement of our work.(改進並指明亮點)隨後對自己的亮點進行總結說明,包括那幾點
星期一, 4月 22, 2024
兩門 Computer Vision 課程
CS 198-126: Modern Computer Vision Fall 2022 (UC Berkeley)
Computer Vision — Andreas Geiger
紀錄下最近囤到的 CV 課,松鼠黨的收藏又增加了 XD
之前 B 站的 CS231 課也不錯,但只有 Justin Johnson 講的我聽的懂,Serana Yeung 在講什麼根本電波對不到。並且課程到後來速度越來越快,只能把一堆研究稍微帶過去,學到的東西很少。換別的課看手氣會不會好點 XD
淺談 Prompt 自動最佳化工具
今天被介紹、推坑了 LLM prompt 最佳化的文章,文中帶出了很多 paper。粗看下來最優先需要了解的應該是 AutoPrompt,其對應 paper 如下:
Intent-based Prompt Calibration: Enhancing prompt optimization with synthetic boundary cases
其他 research 和 paper 乍看也不錯,但暫時沒有動力去看 Q<>Q
最近要做 LLM 和 GPT 有關的 study,這算是及時雨 XD
全文連結星期四, 4月 18, 2024
MedAI Session 20: Many Faces of Weak Supervision in Medical Representation Learning 觀後感
今天用用冗餘時間把 MedAI Session 20: Many Faces of Weak Supervision in Medical Representation Learning 看完一遍。感覺還是卡在同樣的地方,特別是如何用 noisy labeler 產生 probabilistic label 的部分,看來還是要繼續問 GPT 還有補數學。
看的過程中,發現要看的 paper 也更多了。
Data Programming: Creating Large Training Sets, Quickly
這篇也是講 Snorkel 的,但看來比之前看到那篇好懂一些。再努力看看
Doubly Weak Supervision of Deep Learning Models for Head CT
Cross-Modal Data Programming Enables Rapid Medical Machine Learning
這三篇應該算重要收穫了。醫院放報告和影像一大堆,如果可以用報告加影像直接 train model 那做 deep learning 就會變得容易很多(謎之音:我也不用爆肝)。特別是有論文提到用 BERT 去把原始報告轉換成 study-level 的 label,現在有 LLM 可以用 few-shot 感覺這部份會容易很多。
全文連結星期二, 4月 16, 2024
AI 手算與土炮資源
合集·手撕“Everything”系列,Transformer, Diffusion, LLM等
逛網路看到的好資源,分別是手算和土炮類神經網路。以後要扛 AI 研發任務的話還是要有基本功好,松鼠黨的收藏又增加了 XD
全文連結
