顯示具有 研究 標籤的文章。 顯示所有文章
顯示具有 研究 標籤的文章。 顯示所有文章

星期一, 7月 19, 2010

【研究】2.02 SAS procedure set 的建立


在結束data set後,接下來是procedure set。

以proc開頭的就是procedure set的開始
一個data可以同時進行很多個procedure set
如圖中的同時有means和glm兩個分析
接下來就列一下常用的procedure
1. proc means
雖然他叫means,但不只只有means
如果沒下任何指令,他預設會有mean std min max四個數值
但如果你只想看mean & se你可以寫成
proc means data=XX mean stderr;
class 是一定要的,你可以同時class兩種參數
他就會先排第一個,在第一個中,再排第二個。

2. proc glm
這與一般ANOVA分析相同,但他可以處理缺值或重複數不等的狀況
其語法如圖所示,一樣需要class
class的參數則是你想比較的。
單因子就只會有一個
複因子或有區集存在則會有2個或兩個以上
model 就是你的分析模式
也就是y= aX1+bX2+c這類的東西
一個glm可以同時比多個Y也就是觀測值。

接下來就分別以不同的Proc做介紹

星期四, 7月 08, 2010

【研究】第一篇paper

嚴格說起來應該是第一篇自己做的研究。
常常望著桌上厚厚一疊的paper,這不知道是多少人的青春歲月阿。
或者即使不再青春,也是時間的累積。
一點一點的突破,串起來的無數累積。
想想我也是花費了無數的青春歲月呵(淚)
看著許多剛要踏進這領域的學弟妹。
總是覺得學長很厲害,天生就應該幹這行。
我在大三這懵懂的年紀,懂研究?會研究?還是喜歡研究?
誰能知道呢?誰能知道自己是哪塊料?
在這以大學畢業為基本款的時代。
研究所似乎是很多人的企盼,與父母的期望。
那麼聰明,那麼會念書,那就在念一下研究所吧。
這大概是大多數台大學生的宿命吧。
在台灣研究所已經不像研究所了。
所以我們不談研究所,我們談研究。
最近讀了一本書"研究科學的第一步-給年輕探索者的建議"。
這是一本100年前的書。
作者是Santiago Ramin y Cajal 1852-1934
他同時也是1906年諾貝爾醫學獎的得主。
這本書跟一般勵志書不太一樣,真實的呈現出一些在研究路上的窘境。
讓我印象最深刻的是,他指出目前的科學方法,可以有效的解決問題。
但事實上是無法做出好的研究。
利用科學發法,可以很有效率的解決一些問題。
但在做科學研究,有時候還需要一些其他的東西。
亞里斯多德說,作研究的方法是,直覺、靈感與教條主義。
我覺得作研究的態度是,學習、了解與冒險。
不作天馬行空的想像,但偶爾嘗試走些小路。
可能別有洞天。
多一點冒險,多一點刺激。
多采的研究生活。
當然這都是好的一面,誰不想一覺醒來,就想出苯環。
但多數的時間都是在挫敗與懊悔中度過。
無數的失敗,代表著無數的學習與無數的進步。
成就一個研究。

星期五, 11月 27, 2009

【研究】年底

每到了12月,預約著一堆的期末報告。
許多人期待著年終獎金,但每當一年進入尾聲,將是一個痛苦的開始。
每個計畫都即將結案,即使試驗結束,分析結束,山一樣高的數據,也會讓人喘不過氣。
更何況還要寫期末報告。
今天差點就miss了農委會的期末報告,下出了一身冷汗。
只要待在學術界,這樣的週期只會一而再的發生。
一次次的循環。
一篇篇的報告。
一個個青春的日子。

星期六, 11月 07, 2009

【研究】踏上一趟艱辛的旅程

今天又是一年一度碩士班甄試的日子。
因為實驗的關係,一早就到系館來。
看著忐忑不安的大學生,企求著轉換另一個身分。
不斷的深呼吸,調整自己的節奏。
一旁的心也隨之起伏。
時間真的有些久了,久到遺忘了當初青澀的模樣。
遺忘了那份緊張感,與腎上腺素激增的汗水。
前一晚得空就聽聽學弟妹說些什麼。
到底有多少東西是自己想出來的呢?
這考試是要考有研究潛力的人還是有研究能力的人呢?
還是只是一扇門,為那啟程前往另一人生的人們,指引方向。
前往一段艱辛的旅程。

星期五, 1月 23, 2009

【研究】3.02 試驗開始之前:名詞解釋(中)

接著繼續講一些大家都聽過,但有時就是搞不清楚的東西。

6.虛無假說(null hypothesis, H0) 與假說(hypothesis, H1)
   大家都知道,每個分析都需要有假設,也都知道老師都說虛無假說設相等,假說設不相等。
   其實這是一個模糊的說法。
   換個方式說,通常我們在進行研究時,都希望是新的結果或者有差異。
   舉個例子來說,我添加藥物A希望能促進雞隻免疫力的提升。
   因此就會有這樣的假說:
   Ho:有添加藥物A與否對雞隻免疫力沒有顯著提升
   H1:添加藥物A可以顯著提升雞隻免疫力
   簡單的說,Ho是現狀,也許不好,但是可以接受。
   今天妳提出H1跟大家講,可以增加免疫力,你就需要有九成五的把握。
   也就是講這話犯錯的機會只有p<0.05。
   也就是說妳沒有九成五的把握,不能說有效。
   這也是風險比較低的做法。
   如果還是不太懂,可以參考一下
   http://tw.myblog.yahoo.com/yhliu-corner/article?mid=352&prev=357&next=351
   我個人認為寫的還蠻清楚的。

7.自由度(degree of freedom)
   大家都知道,自由度就是n-1,但為什麼要減一呢?
   其實不知道還是可以算,但知道其實也挺有趣的(一定會有人說只有你覺得有趣==")
   就像他的名字,自由度,自由決定的程度。
   我們都知道,如果有3個未知數,至少需要三個方程式,才能解出唯一一解。
   然而在統計計算上,最後一個方程式,會是其他方程式的總和,因此少一個方程式。
   就是無限多組解,因此必須先假定其中一個解,才能順利解出。
   因此有一個是我們沒辦法自由決定的。

8.重複數 replication or repeat?
   做試驗常常會有人問你n值是多少?你重複的幾次?
   n值可以說是該組試驗動物或其他觀測值的多寡。
   也就是我們常說的重複數= replication,他代表的是一個完整個體的觀測值。
   然而repeat在中文上我們也叫他重複,但他的意義是同一個觀測值,多測量幾次。
   確保觀測值的準確度,在統計學上,測1次跟測100次是一樣的。
   但通常我們力求測量的準確都會有重複(repeat)

9.區集(Block)
   講了半天,終於講到一個試驗設計的名詞。
   試驗設計可以分成完全逢機設計(CRD)與逢機完全區集設計。
   簡單的說分別就是一個有區集,一個沒有。
   然而區集是什麼呢?
   簡單的說,他是你在試驗之前就覺得會有差異的因素,但他又不是你想要知道的。
   舉個例子,你想要知道吃不同牧草對產乳量的影響,試驗期維持一整年。
   但學畜產都知道,乳牛冬天產乳亮較高,如此一來組內的差異會變大。
   真正的效果就看不出來,造成誤判。
   因此如果我們把季節設區集,將季節所造成的變異抽出來,可降低MSE(參照3.01)
   區集在動物試驗是很重要的。
   因為我們常常受限於試驗動物或場地或一些無法改變的原因(例如公母生長差異)。
   適當的區集設計,有助於試驗的分析,之後我們會在各設計強調區集的用法


星期一, 1月 19, 2009

【研究】3.01 試驗開始之前:名詞解釋(上)

當讀了無數的paper,與教授不知討論了多少次,終於孵出一個idea。
所以要進行一個試驗,去證實或者了解想要知道的結果。
這時候的你應該如何開始規劃你的實驗呢?
首先我們先來了解一些名詞,以便之後敘述的方便性。

1.變因(variable)?變級(level)?傻傻分不清楚。
   很多人常會把變因跟變級搞混,舉個例子就很容易懂了。
   這裡有很重要的一個概念,就是你要很清楚、明白的了解你的試驗目的,
   設計完才知道能不能達成這樣的目的。
   舉例說明:我們假設吃果糖容易變胖
   狀況一:
   試驗目的:我想要了解吃果糖是不是真的容易變胖
   變因:是否有吃果糖
   變級:果糖與對照組的糖類

   狀況二:
   試驗目的:我想要了解吃不同量的果糖變胖的程度是不是不一樣
   變因:果糖攝取量
   變級:0, 10, 20, 30克等。

   狀況三:
   試驗目的:我想了解吃不同的糖、不同量變胖的程度是否一致。
   變因:糖類來源+攝取量
   變級:各種糖類,不同攝取量
   這樣因該很容易分辨變因跟變級了

2.逢機(隨機, random)
   逢機簡單的說就是機會均等,例如說逢機分組,就是將物品分入每一組的機率相等。
   另一個意義就是希望每組都是均質的。

3.常態分布(Normal distribution)
    這就是大家熟悉的鐘型曲線
    
    也就是常態分布曲線,他有他數學上的定義,事實上我也不是很熟。
    一個正負標準偏差,佔總量約68%,正負兩個標準偏差約95%。
    這未來會出現在ANOVA的分析上,我們要確認資料是呈常態分布,才能滿足分析的條件。

4.敘述性統計
    包含平均值(mean)、標準偏差(standard deviation)、標準機差(standard error)、中數、眾數等
    這些代表的意義,大家可以翻一下統計課本,STD跟SE的差異就是SE多除以n開根號。
    但其意義不太相似,有興趣的人在進一步再去研究。
    簡單的說STD是各觀測值跟平均值差異的平均,SE是各觀測值之間差異的平均。
    另外在一些變方分析表(ANOVA table),會出現
    SEM(standard error of mean) or MSE(Mean Square Error) 都是指所有變異的平均值。
    不論是試驗造成的,個體造成的,一些無法控制的變異總和的平均。
    理論上這值越小,表示你試驗所能控制得變異越多,也就是試驗設計是OK的。 

5.變異係數(coefficient of variation)
    其實他也算是敘述性統計,但因為他常被提起,所以分開講。
    他的算法很簡單,也很容易懂,就標準偏差/平均值 X 100%。
    他通常都拿來檢測你的標準偏差是否過大,也就是個體差異太大或有其他因素在影響觀測值。
    
下一篇,將講一些試驗設計的名詞解釋,包括區集、T-Test、變方分析(ANOVA)、複因子等



星期三, 1月 07, 2009

【研究】2.01 SAS 界面介紹與data set的建立

SAS之所以讓人望而生怯,最大的原因應該是程式語言吧。
需要寫一些程式,所以入門的門檻就不是今天教明天會的那樣低。
但其實也沒那樣的艱難。
基本上我對程式語言也不是很熟,但只要記住幾個簡單指令,你也可以駕輕就熟的使用SAS。
首先SAS可以分為三個部份,edit(編輯program的視窗)、Log(程式的讀取與執行動作的資訊)and Output(結果顯現的地方)。

其他功能我就不多說了,直接進入edit視窗。
在SAS的program裡,也可以分為兩個部份,一是data set, 令一則是procedure  set。
data set簡單的說就是在sas裡建構你要輸入的資料,由於對方是電腦,你就要用他可以了解的方式跟他溝通。
我就先簡單輸入一小段

  

在sas用空格把不同的字區隔開來,“;“當作每個句子的結尾。
深藍色代表著一個區塊的開始,只要是深藍色或淺藍色的字都必須要拼對,有固定格式。
在data後面的a,是任意取的,是給sas程式一個暫存的檔名。
input 後面輸入你所要輸入之變數或應變數,簡單說就是你資料裡的項目。
例如:溫度、處理、體重等等,可以用簡單的英文或符號,但有些符號會造成程式判讀錯誤,目前我所知得%, -都會有問題,在input後面也還不支援中文。
然而在變數或應變數後面的"$"是將前面的那個變數或應變數指定為文字符號,也就是不是數字的意思,即使你在datalines輸入數字,他也會把他當文字。
在input與 datalines(cards也可以) 之間,你還可以對變數作一些四則運算,例如你可以寫b'=(b+10)**0.5,在SAS裡次方的符號不是^而是**,類似的一些計算可以在這邊運作。
接下來就是datalines,也就是你放入資料的地方,這裡的資料可以由excel or 純文字的note複製貼上就OK了。
維三需要注意的。
一、如果有缺值以“.“代替,不能空白。
二、上圖E b c d對應1 2 3 4,有時候你可能就一直輸入,例如 1 2 3 4 5 6 7 8放在同一行,但以這樣的program他讀完1234就換讀下一行,但其實也沒很難,你只要在input最後打上@@,他就會讀到結束再換行。
三、輸入完成候,以分號結束,但那分號,要在下一行,如上圖,如果打在12後面,就會出錯,詳細原因我也不知道,不打還不會錯,打錯地方就錯定了。

下一篇將探討procedure set,敬請期待XD

星期六, 12月 27, 2008

【研究】3.00 什麼是試驗設計?

很多研究生對於試驗設計常常會跟統計劃上等號。
試驗設計的確需要使用統計的技巧,但試驗設計與統計學是不同的。
其實我們從小就學過試驗設計,控制變因、操作變因跟應變變因的概念,還有對照組。
其實這些東西就是試驗設計的中心思想,簡化影響試驗的變因。
將變因單純化,一次只探討一個變因。
但到了真的做研究時,往往因為一些現實的因素,並無法一次只探討一種變因。
因此有了試驗設計學這門學科。
在四年級時,我去修了一門試驗設計學,才把過去矇矇懂懂的概念整理起來。
學得不多,但對於未來的研究差不多夠了。
前陣子學弟妹在看paper時,往往統計學的部份好解決,就算不懂原理,只要知道p<0.05就是有差異,也不難解決。
但相較於試驗設計,則是完全沒有概念。
區集、複因子,n要等於多少才夠,MSE? SEM?
想想這些我習以為常的東西,沒學過還真的有障礙。
接下來就野人獻曝一下,希望對大家有幫助。

星期日, 11月 30, 2008

【研究】2.00 SAS基礎篇 : 在開始sas之前

老師或老闆常常會說,“就跑一跑SAS就好啦!!“
其實這是奇怪的一句話,但大家都約定成俗的了解他的意思。
或其實不了解。
SAS是一個程式,表面上的意思是去run這個程式,但其實他真正的意思應該是將資料作一下統計分析。
所以其實最終目的是要做統計分析,而SAS只是一個工具。
因此可以做這樣分析的軟體很多,甚至用手算也是一個方法。
但隨著年紀增長,計算能力成反比的衰退,勢必用手算也只是增加實驗的誤差。
利用計算程式就可以達成的部份,我們就別為難自己了。
能做這件事的程式很多,EXCEL, SPSS, STATE, P-project......當然還有SAS。
如果你問我為什麼要用sas,其實原因很簡單,因為我只會用sas XD。
撇開真實的玩笑話,SAS是目前生物醫學研究領域大家慣用的統計分析軟體,因此我就學了這一套。
其他例如SPSS是社科領域慣用的,R-project是網路上正興起的一套。
如果你的資料量不是很龐大,或只是交一個學期報告,並不是要投稿發表的文章,使用比較容易入手的EXCEL,其實也是一個不錯的選擇,但這一篇文章並不會探討EXCEl。
因為我真的不會使用XD。

在開始學著打簡單的程式語言前,你必須先入手這一套軟體。
但他是一個昂貴的軟體,但在台大的我們,很幸運的,你只要到系辦公室或院辦公室,就可以得2到這一套軟體。
安裝好之後,就可以準備看2.01了。
但在這邊提醒大家,sas只是一個工具,重要的還是你的試驗設計。
在了解你的試驗的狀況下,你才能對你的數據做充分且正確的解釋。

星期四, 11月 20, 2008

【研究】1.03 研究工具篇:老闆可能不知道的事

這是一個資訊爆炸的時代,被動的接受資訊已經沒辦法滿足對最新資訊的需求(或者說沒辦法滿足老闆或研究)。
常常在報告時,老師就會問這是最新的報告嗎?
有些老師會定時搜尋一些Topic,過定時去逛一些journal,掌握某些領域最新的資訊。
然後就會跟學生說,自己要掌握最新的資訊。
但新時代有新做法,我們可以把這些資訊利用新科技叫他自己送上門。
先說一個比較舊的方法:mail alert

Mail Alert
其實就是訂閱電子報,有些網站只有提供Alert的功能,你就跟他訂閱妳想看的部份,有新期刊出現就會寄到你信箱,只要定期查閱就OK了。
如果只說這個就遜掉了,我要說的是統合式的mail alert。
有些journal自己並沒有網站,而是交給某一網站託管,例如:ScienceDirect.
他的mail alert等於是加強板的,你可以選擇某一個關鍵字,例如:nutrition。
他定時會將這陣子所出來的期刊,做搜尋的動作,或你依照他的分類選擇也可以。
他等於就是在做你老闆在做的事,只是當你設定好了,他就會自動奉上。

RSS or Feed or Atom
其實這也是電子報,只是稍稍不同。
有提供rss服務的期刊,他都會在網站裡有rss的按鈕。
我們以nature為例: 

在網頁的右邊有一堆連結

這些連結都是同一個目的,就是要把paper送到你手上。
但我要說的是live newsfeed這一個,用力把他按下去。

有些網站只有一種服務,就會直接跳到下一個頁面,但nature畢竟是nature所以麻煩選擇其中一個再按一次。

由於我所使用的瀏覽器是Mac的safari,跟ie or firefox可能有點不同,但網址應該是類似的,也就是feed://XXXXXX.XXXXX。把這個網址加入我的最愛。
當你打開你的書籤或我的最愛,你可以發現類似這樣的狀況,在你訂閱的期刊後面,會有括號,裡面的數字就是新出的文章,你尚未閱讀。
因此你可以找幾個相關領域的journal加入追蹤。
有些Blog也有提供rss服務,可以第一手得知某人的訊息。
新時代,新做法,有些老闆也許知道啦。
跟你老闆分享一下也不錯。

星期二, 11月 18, 2008

【研究】1.02 研究工具篇:工具網站

Protocol online
據說是一個麻省理工的研究生,某一天突然覺悟,發現浪費很多時間在找protocol,於是收集了一些資訊,架設了這個網站,之後越來越多的protocol就上傳在這邊,裡面東西真的非常的多,甚至有些是實驗室自己的撇步,同一個做法有許多不同步驟,可以一次參考很多不同人的心血結晶。

Google系列

上一篇已經介紹過他了,這個連結是英文的,所以部份的英文書籍,也可以在這邊找到。
這也不用多說了,PubMed找不到想要的資料,可以來這邊碰碰運氣。
這是一個有關專利的一個功能,其實還在測試階段,為什麼會找到呢?首先我在ATCC找到一株菌,沒有相關文獻,只有說可以產Homoserine,正在煩惱找不到基本資料時,結果看到在ATCC的參考文獻有一串號碼U.S.XXXXXX,就把他丟進Google找一找,就發現了這個功能,他可以下載該專利的專利書,專利書中也有一些培養的資訊,跟一些研究的數據,對於一些只有專利沒有文獻的研究,是很重要的參考資料,另一個就是在用的時候要注意專利的問題,以防以後推廣上有困難,一般專利年限是20+5,最多25年。

營養相關
學營養的人都應該要知道的NRC

其他

化學標準分析法的網站。
一些比較新的生物名詞都有
台灣的菌種中心,需要買菌可以來這,比較便宜
美國的一個菌種中心,東西比較多,除了菌,還有培養基的資訊。
有時候英翻中也會困擾人,有些專有名詞是有固定說法的。
並不是所有的碩博士論文都會發表,在這都可以找到。
想要了解台灣的畜牧現況,請來這邊查。

【研究】1.01 研究工具篇:找尋文獻

很多研究生面臨的第一件工作就是找文獻。
書本是提供知識的一個重要捷徑,所以相關書籍是妳第一個可以去搜尋目標。

圖書館

搜尋相關書籍第一個當然是找上學校的圖書館。
在台灣你還可以找上國家圖書館,還有中央研究院圖書館。
另外大多數的學校圖書館都有跨館借書的服務。
另外萬能的Google大神也有提供圖書搜尋的服務,目前還是Beta版,之後應該會更完善吧。
但已經很好用了,有些書籍在取得授權後,甚至可以在線上閱讀,但目前解析度都不是很好。

雖然書籍是個很好參考資料,但即使是今年出的書,也是數年前的研究發現,更不用說那些十幾年前的書,累積的是上半個世紀的知識,這也是為什麼需要搜尋較新Paper的原因。
要搜尋paper首先要挑資料庫,因為我們是生物醫學領域,目前最大的資料庫是PubMed
他是NCBI中的一個部份,可以利用關鍵字搜尋,也可以使用其他作者或年代等等。
我個人認為在PubMed裡最方便的是他會將review分出來,在剛開始接收資訊中,review是一個不錯的方式,他就像一本小書,把近幾年相關的研究統整起來,有相關領域大師級人物寫出來。
由PubMed找到的文章,點進去大多都有摘要,但不一定有全文。
許多期刊會提供免費的全文下載(連結匯出現在摘要那一頁的右上角),但也有部份需要付費。
基於全台灣最受照顧的學生,台大買了很多電子期刊。
有些付費期刊妳在點全文下載時,如果妳在台大網域內,妳就會直接繞進去,就可以下載。
但有些網站無法做到這項服務,因此妳可能必須到圖書館網頁,搜尋該本期刊,由圖書館的連結連出去。
另外一種情形就是根本沒有電子期刊,你就必須去查查圖書館是否有買紙本,可能就需要跑圖書館一趟。

PubMed裡的期刊,大多都是SCI的期刊,因此他是有經過篩選的,而且他只有生物醫學領域的相關期刊,如果你是社會科學領域,我就完全不知道建議你選哪個資料庫,或者你今天想找的只是一篇研討會的報告,或只是研究成果並不一定有發表,這些東西找的到嗎?
這時候又要稱讚一下Google大神,有一個新的服務,Google Scholar,雖然他也是Beta板,但已經非常好用了。
你所搜尋到的都是一些學術相關的資料,所以不會像是只用Google搜尋,有幾萬筆。
一些沒有發表的文章也會在這找的到,但要使用這樣的資料要很小心,必須要自己判斷其正確性。因為沒有通過期刊把關的文章,可信度相對就會低一點。
通常能找到這樣就差不多讀不完了,如果沒有找到可能是關鍵字的問題,可以多試幾個關鍵字,交叉搜尋,或是由paper後面的reference找相關paper。
大概就是這樣了,下一單元再來講一下,其他有用的網站。



星期一, 11月 17, 2008

【研究】1.00 研究工具篇:序論

看到了研究生2.0後,心中也浮現著想要把自己所知的一些事情,跟大家分享。
也許是野人獻曝,也許是以井窺天,但或多或少都是一些經年累月的經驗。
希望對於要進入研究領域的人們有所幫助。
但其實懂得也有限,目前規劃了幾個單元

1.00 研究工具篇
         介紹一些實用、常用的軟體,或一些網站資訊等

2.00 sas基礎篇
         其實我也只會基礎,但對於動物學領域,大多都夠用了。

3.00 試驗設計篇
         大家也許都學過統計,但對試驗設計也許還很陌生。
         為了避免每次都要跟前來協助的人解說一次,乾脆都寫在這吧

就讓我們開始上課吧!各位同學。