技術文章
技術問答
My Project
iT 徵才
聊天室
2026 鐵人賽
登入/註冊
文章
問答
Tag
邦友
鐵人賽
搜尋
ozymxt
(ozymxt)
iT邦見習生 ‧ 點數
112
1900
累計瀏覽數
2
人
在追蹤
站內簡訊
追蹤
個人背景
0
發問
25
文章
0
My Project
0
回答
0
邀請回答
0
最佳解答
其他
鐵人檔案
收藏的問題
收藏的文章
追蹤的問題
追蹤的文章
追蹤的tag
追蹤的邦友
Like的發問
Like的回答
Like的文章
Like的留言
問答討論
問答回應
文章留言
文章回應
聊天室
訂閱列表
ozymxt 的發文列表
25
0
Like
0
留言
63
瀏覽
技術
Day15 自我進化的開端:Self-play 迴圈與 Multi-Agent 協作入門
18th鐵人賽
2026-09-22
由
ozymxt
分享
1
Like
0
留言
80
瀏覽
技術
Day14 當 Agent 開始作弊:故意設計錯誤 Reward 誘發 Reward Hacking
18th鐵人賽
2026-09-21
由
ozymxt
分享
0
Like
0
留言
48
瀏覽
技術
Day13 成功的一半:為什麼對 Agent 來說「環境設計」比演算法更重要?
18th鐵人賽
2026-09-20
由
ozymxt
分享
0
Like
0
留言
111
瀏覽
技術
Day12 獎勵機制的抉擇:Outcome vs Process Reward Model 與可驗證獎勵
18th鐵人賽
2026-09-19
由
ozymxt
分享
1
Like
0
留言
59
瀏覽
技術
Day11 Agent RL 與傳統 RLHF 的本質差異及 Credit Assignment 難題
18th鐵人賽
2026-09-18
由
ozymxt
分享
0
Like
0
留言
124
瀏覽
技術
Day10 DeepSeek 背後的演算法:GRPO 與 PPO 差異比較
18th鐵人賽
2026-09-17
由
ozymxt
分享
0
Like
0
留言
115
瀏覽
技術
Day9 DPO vs PPO:為什麼 DPO 不需要 Reward Model 且更適合微調?
18th鐵人賽
2026-09-16
由
ozymxt
分享
0
Like
0
留言
104
瀏覽
技術
Day8 人工標註的陷阱:Reward Model 訓練實戰與資料品質探討
18th鐵人賽
2026-09-15
由
ozymxt
分享
0
Like
0
留言
68
瀏覽
技術
Day7 拆解 RLHF 全流程:SFT、Reward Model 到 PPO 的 Pipeline
18th鐵人賽
2026-09-14
由
ozymxt
分享
0
Like
0
留言
69
瀏覽
技術
Day6 邁向 LLM 時代:Clip 大小實驗與第一階段 RL 脈絡總結
18th鐵人賽
2026-09-13
由
ozymxt
分享
回第一頁
上一頁
下一頁
ozymxt的鐵人檔案
ozymxt的收藏
收藏的問題
收藏的文章
ozymxt的追蹤
追蹤的問題
追蹤的文章
追蹤的tag
追蹤的邦友
ozymxt的Like
Like的發問
Like的回答
Like的文章
Like的留言
ozymxt的紀錄
問答討論
問答回應
文章留言
文章回應
聊天室
ozymxt的訂閱列表
封鎖 ozymxt
×
標記使用者
輸入對方的帳號或暱稱
Loading
找不到結果。
標記
{{ result.label }}
{{ result.account }}