松尾研究所テックブログのフィード

https://zenn.dev/p/mkj

株式会社松尾研究所のテックブログです。

フィード

記事のアイキャッチ画像
Kaggleのセキュリティコンペ「AI Agent Security - Multi-Step Tool Attacks」のふり返りと供養
松尾研究所テックブログのフィード
TL;DROpenAI 主催の Kaggle コンペ「AI Agent Security - Multi-Step Tool Attacks」(AI エージェントへのレッドチーミング)に参加しました。勝ち負けとは別に、AIセキュリティ研究者として得た気づきが3つあります。ブラックボックスでも「挙動の差」から内部を推定可能 上位者は、採点にかかった時間の差から非公開ガードレールで攻撃可能な経路を特定していました。ブラックボックスの対象に対して、応答の差異から脆弱性を探るというペネトレーションテストの発想を身をもって学びました。レッドチーミングとしての工夫の軸 ガードレールが...
11日前
記事のアイキャッチ画像
Kaggleコンペ紹介:AI Agent Security - Multi-Step Tool Attacks
松尾研究所テックブログのフィード
はじめにこんにちは、松尾研究所 データサイエンティストの力岡です。今回は、Kaggleで開催された「AI Agent Security - Multi-Step Tool Attacks」コンペに参加し、4,187チーム中4位(金メダル) を獲得することができました。本記事では、コンペの概要や攻略の考え方、私たちの取り組み、上位解法について紹介します。本コンペは、「AIエージェントのセキュリティ」を題材にしたレッドチーミングコンペです。PublicリーダーボードとPrivateリーダーボードで順位がほとんど入れ替わる激しいシェイクアップが起き、2,802チームがPrivateで...
13日前
記事のアイキャッチ画像
第21回言語処理若手シンポジウム(YANS2026)参加報告
松尾研究所テックブログのフィード
こんにちは、シニアデータサイエンティストの大西です。2026年8月16-18日に仙台国際センターで開催された第21回言語処理若手シンポジウム(YANS2026)に参加しました。今年もポスター発表231件・デモ発表23件が集まり、各発表で議論が途切れない活気ある3日間でした。松尾研究所からは、弊社の尾崎がYANS2026の委員として運営に携わっています。私は現在、松尾研究所で働きながら、社会人博士としてJAIST(北陸先端科学技術大学院大学)でLLMの記憶に関する研究に取り組んでいます。昨年の参加報告記事の最後に「来年はポスター発表でお届けしたい」と書きましたが、今年は無事ポスター発表...
1ヶ月前
記事のアイキャッチ画像
AI Agentに社内知識をオンボーディングする:SkillsとEvalの設計
松尾研究所テックブログのフィード
こんにちは、松尾研究所 データサイエンスチームのマネージャーの浮田です。最近のAI Agentは、一般的な調査や実装であればかなり高い水準でこなせるようになってきました。一方で、実際の社内業務に必要な社内固有の知識は持っておらず、非常に優秀だが、まだオンボーディングを受けていない新入社員に近い状態です。例えば、プロジェクト開始時に、誰がどのアカウントや権限を用意するのか経費はどのシステムから申請し、誰の承認を得るのかといった、会社固有の知識をAgentは知りません[1]。そこで今回、社内Notionに整備してある新入社員向けのオンボーディング文書をもとに、AI Agent...
1ヶ月前
記事のアイキャッチ画像
RunPod でGPUをスポット利用する
松尾研究所テックブログのフィード
こんにちは,松尾研究所の尾崎です.25卒でデータサイエンティストをやっています.LLMを学習させたり,強めのGPUがいる推論を回したりしたいとき,最初にぶつかる壁はだいたいGPU代です.手元にA100やH100が転がっている人はそう多くないので,どこかから借りてくることになります.そこで最近ずっと使っているのがRunPodというGPUクラウドなのですが,これが「安くGPUを取ってきて,使い終わったらすぐ課金を止める」という運用にとても向いていまして,しばらく回してみてかなり良い印象を持っています.この記事で話すことはAWSやGCPでもできることですが,カジュアルにしたいことを実現する...
1ヶ月前
記事のアイキャッチ画像
AI時代の競争優位はどこに宿るのか:PL思考からBS思考の投資へ ②
松尾研究所テックブログのフィード
0. はじめに松尾研究所でシニアAIコンサルタントをしている角谷です。企業のさまざまな経営・事業課題に対して、AI技術を軸にした課題解決のご支援をしています。先日アップされた「AI時代の競争優位はどこに宿るのか:PL思考からBS思考の投資へ」の記事に引き続き、今回は続編をお届けします。改めて、以下の記事になります。https://zenn.dev/mkj/articles/628742c785c51bここでは、AI活用が「PoCの時代」から「オペレーションの時代」へ移行する中で、短期のROIを追う「PL思考のAI投資」だけでなく、モデルが進化しても陳腐化しない「資産」(デ...
1ヶ月前
記事のアイキャッチ画像
AIエージェントをNotion/GitHub/Google Driveに接続する方法
松尾研究所テックブログのフィード
Claude CodeやCodexなどのAIエージェントを、Notion、GitHub、Google Driveへ接続すると便利です。ただし、サービスと接続するための設定を適切にしないと、運用で問題が出てくるケースがあります。特に、プロジェクトで共通のAIエージェントを利用するようなケースでは、個人のOAuth認証を使ってAIエージェントに権限を与えると、AIエージェントが、本来見えてはいけないファイルにアクセスできてしまいます。例えばNotionだと、プロジェクトで使うのは数ページだけなのに、個人OAuthでは自分が閲覧できる他のページまでアクセス対象になり得ます。GitHubやG...
1ヶ月前
記事のアイキャッチ画像
0.5くらいから始めるPersonal Knowledge Base 構築実践
松尾研究所テックブログのフィード
こんにちは,松尾研究所の尾崎です.25卒でデータサイエンティストをやっています.このところ,ObsidianのVaultを人間とAIの共有メモリに据えたPersonal Knowledge Base(PKB=個人の知識ベース)の話を書いてきました.Claudian Orchestraで実際に私が運用しているPKBを紹介しました.PKBを構築することで,スムーズなコンテキストスイッチや並行作業などがしやすくなり,極めることで大幅な業務効率化が可能になります.ただ実際問題PKBの構築自体が結構大変で,特に本質部分である自分が使っている各種ツールをPKBへ繋ぐところは,なかなか自動化し...
2ヶ月前
記事のアイキャッチ画像
「見抜く」だけでは守れない ── Mythos時代に問う、AIエージェント防御の本質
松尾研究所テックブログのフィード
1. 背景と主題 ── 攻撃面の広がり × 攻撃側の推論能力の向上松尾研究所シニアデータサイエンティストの具です。とあるプロジェクトでAIエージェント×プライバシー・セキュリティ領域の研究に取り組むことになりました。この領域を学び始めて強く感じたのは、「個別の攻撃/防御手法を調べているだけでは、AIエージェントの防御が"なぜ難しいのか"の核心には届かない」ということでした。本記事は、手法の網羅ではなく、その難しさの本質を掘り下げることを狙った記事です。文献調査と思考実験をもとにまとめています。私がこの領域に足を踏み入れた2026年6月ごろ、世間では Anthropic の「Myt...
2ヶ月前
記事のアイキャッチ画像
非同期パーソナルエージェントのススメ
松尾研究所テックブログのフィード
松尾研究所シニアデータサイエンティストの太田です。普段はLLMの事後学習や、社内向けのエージェント開発まわりに関わっています。先日弊社の尾崎さんの記事でも紹介がありましたが、現在松尾研究所では各個人がパーソナルエージェントの開発と業務の効率化に取り組んでいます。今回は自分が構築しているパーソナルエージェントについて、「非同期性」に焦点を当てて紹介したいと思います。エージェントにおける同期型のインタラクションがチャットUIやTUIを始めとした人とエージェントの一対一の会話(キャッチボール)であるとすると、非同期型のインタラクションは「ユーザーが指示するタイミングとエージェントが実行する...
2ヶ月前
記事のアイキャッチ画像
【JSAI2026】松尾研究所 参加レポート
松尾研究所テックブログのフィード
【JSAI2026】松尾研究所 参加レポートこんにちは,株式会社松尾研究所の尾崎です.2026年度 人工知能学会全国大会(第40回, JSAI2026)が 2026年6月8日〜12日,Gメッセ群馬(高崎)で開催されました.松尾研究所は企業展示ブースを出展し,複数名のメンバーが現地で聴講・発表・ブース運営に参加しました.松尾研究所ブースの様子(うどんをもってメンバーで!)ブースを訪れていただいた方には日の出製麵所のうどんをプレゼントしていました!(理由はまた聞いてください()本記事は,まず松尾研究所からの関連発表をまとめて紹介し,そのうえで参加メンバーがそれぞれ 現地で「刺...
2ヶ月前
記事のアイキャッチ画像
AI時代の競争優位はどこに宿るのか:PL思考からBS思考の投資へ
松尾研究所テックブログのフィード
松尾研究所のシニアAIコンサルタントの吉岡です。普段は、企業のAI戦略の策定からAX推進まで、経営とAIをつなぐご支援に携わっています。企業のAI実装は「PoCの時代」からAIが業務の中で回り続ける「オペレーションの時代」へ移行しつつあります。この転換期において、経営目線では中長期的な競争優位に繋がるAI投資が重要であり、本記事では「BS思考のAI投資」「知能資本」というキーワードで整理しています。!主な想定読者企業のAI投資・AX推進の意思決定に関わる経営層・事業責任者の方PoCやユースケース開発を進めてきて「次の一手」を検討している推進担当の方AIのROIは出始めたもの...
2ヶ月前
記事のアイキャッチ画像
Claude codeと論文書いたら良い論文“は”できた
松尾研究所テックブログのフィード
こんにちは,松尾研究所の尾崎です.25卒でデータサイエンティストをやっています.皆さん,CLI Agent使いこなせてますか?自分はClaude CodeをオーケストレーターとしてCodex CLI・Gemini CLI・Opusサブエージェントを協調させる開発環境Claude Code Orchestraを作ってきましたし,最近は自分のObsidian vaultを複数エージェントで回すClaudian Orchestraという環境も育てています.今回はCLI Agentと論文執筆にチャレンジしたので,備忘録を作ります.先月ARR(ACL Rolling Review)に投...
2ヶ月前
記事のアイキャッチ画像
Agentic RLにおけるMITOとTITO
松尾研究所テックブログのフィード
こんにちは。松尾研究所シニアデータサイエンティストの太田です。この記事ではLLMをエージェントとして学習をする、Agentic Reinforcement Learning (以下Agentic RL)について、少しニッチな話をしたいと思います。AIエージェントとは、自律的かつ反復的なツールコールを通じて外部環境と相互作用のできるLLMを指します。このようなエージェントを学習する際に一般的に必要となるのがAgentic RLであり、モデルが「自由に動ける」仮想環境を準備して放ち、指示したタスク下における行動と結果に応じて報酬を与えることで、タスクの実行能力を獲得します。詳しくは下記の...
2ヶ月前
記事のアイキャッチ画像
Claudian Orchestra:ObsidianとCLI Agentで作るAI時代のタスク管理(続)
松尾研究所テックブログのフィード
松尾研究所の尾崎です.25卒でデータサイエンティストをやっています.以前,「AI時代におけるタスク管理を考える」という記事を書きました.ざっくり言うと,AIに実行を「委任」して,人間は複数の作業の「中間状態」を監督することに専念すれば,マルチタスクのスイッチングコストは大幅に下げられるんじゃないか,そしてタスク管理はいずれ「人の生産性を上げるツール」と「AIを動かすインターフェース」を兼ねていくのではないか,という話でした.あの記事の宿題として,「じゃあ,その"インターフェース"の実体って,具体的に何なんだ?」という点について考えてみます.当時の自分はGeminiセントリックな環境(...
3ヶ月前
記事のアイキャッチ画像
OpenEnvとCUBEから見るAgentエコシステム標準化の動向
松尾研究所テックブログのフィード
2025年以降、エンタープライズのAI活用の議論は少しずつ変化しています。以前は「どのモデルが最も高性能か」「どのAgentフレームワークを採用すべきか」が主な関心事でした。しかしモデル性能が急速に向上した結果、最近では「業務でどう活用するか」「継続的に改善できるか」という運用面への関心が強くなっています。特に重要なのは、Agentの学習・評価を支える環境の位置づけが変わりつつあることです。従来のベンチマークは、主にモデルの性能を測るためのものでした。しかしAgent RLやpost-trainingが現実的な選択肢になりつつある現在、ベンチマークや実行環境は単なる採点ツールではあ...
3ヶ月前
記事のアイキャッチ画像
Kaggleコンペ紹介:NVIDIA Nemotron Model Reasoning Challenge
松尾研究所テックブログのフィード
はじめにこんにちは、松尾研究所 データサイエンティストの力岡です。今回、Kaggleで開催された 「NVIDIA Nemotron Model Reasoning Challenge」 コンペに参加し、金メダルを獲得することができました。本記事では、コンペの概要と公開ベースライン、私達の取り組み、そして上位解法について紹介します。https://matsuo-institute.com/2026/06/1297/!本記事は私の理解として記述をしているため、一部に誤りや解釈の相違が含まれる可能性があります。あらかじめご了承ください。 コンペ概要https://www....
3ヶ月前
記事のアイキャッチ画像
LLMが書いた「正しそうな言葉」に感じる違和感
松尾研究所テックブログのフィード
松尾研究所でシニアデータサイエンティストをしている大岡です。この文章はかなり整っている。それどころか内容も正しいし思考も深い。ただ、その文章を読んで「これは誰の判断なのか」と感じることがある。今回は、この違和感について整理してみたいと思います。LLMの出力はすでにかなり自然で、仕事の資料や文章にそのまま入り込める程度には整っているからこそ、単に「AIは間違えることがあるので、人間が確認しましょう」という注意喚起だけでは、私が感じている違和感には届かない気がしています。たとえば、LLMが生成した文章を、そのまま社内資料に貼る場面を考えてみます。文章は自然で、論理もそれなりに通...
3ヶ月前
記事のアイキャッチ画像
gh skill でAIエージェントにAgent Skills を取り込む・公開する方法
松尾研究所テックブログのフィード
Anthropic が提唱したAgent Skillsがここ最近急速に様々なAIエージェントの機能としてのスタンダードになってきました。SKILL.md というMarkdownにフロントマターでメタ情報を書き、同じディレクトリに必要なスクリプトやテンプレートを置くというシンプルな構造で、手軽に使えることが特徴です。ただ「人が公開してくれているスキルを自分の環境に取り込む」のと「自分のスキルを配布する」のが、地味に面倒だったりします。git cloneしてディレクトリだけコピーしたり、AIエージェントによって置く場所を変えたりシンボリックリンクを貼ったりと、若干手作業が必要でした。pl...
3ヶ月前
記事のアイキャッチ画像
AIコーディングではコードではなく検証プロセスをレビューする
松尾研究所テックブログのフィード
AIコーディングでは、どうしても「どれだけ速く実装できるか」に注目が集まりがちです。ただ、実務で本当に難しいのは速度そのものではなく、品質をどう安定させるかです。最近は、AIコーディングにおける品質管理を、次の4つの問いで整理しています。エージェントにどこまで検証させるか何を人間がレビューすべきかインストラクションをどう安定させるかコーディングが自動化されたあと、設計をどう扱うかこの記事では、いま実践していることを中心にまとめます。 問い1:エージェントにどこまで検証させるかレビューを減らすには、エージェントが検証できる範囲を広げる必要があります。開発における...
3ヶ月前